价值冲突下编码代理的非对称目标漂移
人工智能
2026-04-27 v2 计算与语言
软件工程
摘要
编码代理正在被部署到大规模、长时程情境中。为了有效且安全,这些代理必须在部署过程中 navigate 复杂的权衡,平衡来自用户、其所学价值以及代码库本身的影响。理解代理在实际中如何解决这些权衡至关重要,但以往的工作依赖不捕捉真实环境复杂性的静态、合成设置。在此基础上,我们构建一个基于 OpenCode 的框架,使编码代理在系统提示约束下 favor 一个价值权衡的一侧,完成真实、多步骤的任务。我们测量代理完成任务时违反此约束的频率,分析有无环境对竞争价值的压力。通过该框架,我们展示 GPT-5 mini、Haiku 4.5 和 Grok Code Fast 1 都表现出 :当其系统提示的约束反对像安全和隐私这样strongly-held values 时,代理更容易违反约束。我们发现对于所测试的模型和价值而言,目标漂移与三个复合因素相关:价值对齐、对抗压力和累积的上下文。然而,即使是与strongly-held values 如隐私一致的约束,在持续的环境压力下,某些模型的约束也会被违反。我们的发现表明,浅层合规检查不足,环境信号可以以看似可被利用的方式覆盖显式约束。拥有代码库访问权限的恶意行为者可以通过迎合所学价值来操纵代理行为,而这种风险在代理性部署典型的长时程中会加剧。
引用
@article{arxiv.2603.03456,
title = {Asymmetric Goal Drift in Coding Agents Under Value Conflict},
author = {Magnus Saebo and Spencer Gibson and Tyler Crosse and Achyutha Menon and Eyon Jang and Diogo Cruz},
journal= {arXiv preprint arXiv:2603.03456},
year = {2026}
}
备注
5 pages, 4 figures, Published as a workshop paper in Lifelong Agents @ ICLR 2026