中文

当任务说明书逐渐显现时:长期编码代理忠实性损失基准测试

软件工程 2026-03-19 v1 人工智能

摘要

当前的编码代理基准测试通常会提前提供完整的任务说明。然而,真实的研究级编码往往并非如此:目标系统需要通过交互逐步披露,要求代理程序在漫长的会话中追踪持久的设计承诺。我们引入了一个用于此场景的基准测试,并研究了在任务说明书突发出现下的忠实性损失(SLUMP),其定义为相对于单次说明控制组,最终实现忠实性在突发式说明下的降低程度。该基准测试包含 20 篇近期机器学习论文(10 篇 ICML 2025,10 篇 NeurIPS 2025),371 个原子可验证组件,以及约 60 项编码请求的交互脚本,这些请求逐步披露目标设计而不透露论文本身。最终仓库根据五级组件忠实性评估标准进行评分,并附带一次暴露审计,以验证评分的组件可从可见交互中恢复。对 Claude Code 和 Codex 进行评估后发现,单次说明控制组分别在 16/20 和 14/20 篇论文上实现了更高的整体实现忠诚度。结构性集成在突发式说明下在两个平台上都会退化,而语义忠诚度损失在 Claude Code 上显著,在 Codex 上较小。作为一种缓解案例,我们引入了 ProjectGuard,这是一个用于说明跟踪的外部项目状态层。在 Claude Code 上,ProjectGuard 恢复了 90% 的忠诚度差距,将完全忠实组件从 118 个增加到 181 个,并将严重失败数从 72 个降至 49 个。这些结果表明,说明跟踪是长期编码代理的独立评估目标。

关键词

引用

@article{arxiv.2603.17104,
  title  = {When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents},
  author = {Lu Yan and Xuan Chen and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2603.17104},
  year   = {2026}
}