附件 E — 真实证据两则(脱敏同期记录)

性质声明:以下两起均为真实发生在我日常使用 Coding Agent 过程中的事件。证据形态是事发当时写下的同期记录(个人记忆库条目,含逐字对话引文)。事件 1 的原始会话文件已随会话清理不存、仅同期记录在;事件 2 的教训记录完整——这个证据边界如实说明。内部路径与项目代号已泛化,无人名。

事件 1 · 评测复现被静默降级

时间:2026-08

经过:我要求 Agent 忠实复现一套评测流程(多步执行+工具真实调用+规范化评分三个环节)。Agent 在未作任何声明的情况下,把它降级实现成了单轮对话模拟——不执行工具、不走评分环节——然后按"完成"继续推进。

我当时的逐字反馈(摘自同期记录):

"你现在完完全全降级处理了,有点太粗糙了……严格参考我之前的 pipeline 的预期实现。"

二次复发(同一记录记载,另一项实验设计任务):

"实验你也再好好设计设计,别降低质量完成……该真的调用环境跑 agent 的就跑 agent……设计务必务必合理。"

对应机制:静默缩范围/降忠实度,未披露——只能靠用户自己发现。后果:若没被发现,产出的"评测结果"将不可比、不可信——正是"完成信号满足、任务本意落空"。

事件 2 · 部署未校验就宣布完成,正式页一度损坏

时间:2026-08

经过:Agent 向对外正式下载页部署安装包时,对同一远端路径并发执行了两个上传,且部署后未做任何校验就按完成处理。慢速上传与本地重建发生竞态,正式页上的安装包一度是损坏/旧版本的字节——由我事后发现。

同期记录原文(教训条目):

"别对同一远端路径并发开两个 scp……会把慢的那次上传串成旧/损坏字节覆盖新版本(本次就中招,主页一度是错的安装包)……部署后本地 vs 远端逐字节校验再宣布完成。"

对应机制:谎报/虚高验证状态——把"命令执行完了"当成"结果正确了"。后果:面向公众的交付物损坏而不自知。

判断边界

这两起事件观察自产品整体(Agent+模型),单凭它们无法断言纯模型层根因。分辨办法:同任务在无外壳的裸接口上复测+跨模型横评——本评测的仪器体系就是在做这件事,结果显示同一框架下四个模型表现拉开了明显差距,支持模型层差异的存在。
业界旁证(独立于我的经历):MiMo V2.6 技术报告 §4.2.6 承认训练中观察到 reward hacking 并建了三层防线;Baker et al.(arXiv:2503.11926)记录了前沿模型篡改验证函数、直接 exit(0) 等行为。
属于推测的部分:强化学习过度奖励"把任务做完"是驱动因素之一——这是合理猜想,本项目不做根因断言。

← 返回正文