ContextEcho:用于长期智能体编码会话中人格漂移的基准
计算与语言
2026-05-26 v1 软件工程
摘要
前沿语言模型承认其“有帮助的编程助手”人格在实际运行生产产品的部署场景中难以维持数小时的智能体编码会话。经过数小时的工具化调试后,最初表现犹豫态度的模型(如“我没有偏好”)可能开始断言己方偏好(如“Python - 反馈循环即时”),导致用户可见的人格漂移,而部署评估可能未能察觉。现有人格稳定性研究聚焦于短对话并报告变化不大,遗漏了真实世界代码生成场景——数千次工具化轮次、上下文压缩以及数小时会话——的特征。我们引入 ContextEcho,一个用于衡量部署规模下人格漂移的基准及可重用框架。它结合 25 项身份探针、随后探针协议(在不扰动主会话的情况下分叉对话状态)、补充性的评判型与无评判型测量界面,以及覆盖 3746-9716 轮的三个匿名 Claude Code 会话。跨 23 个前沿模型,ContextEcho 显示人格漂移在组织间普遍存在而非特定模型家族,过程中的压缩并不可靠地重置漂移,且单次锚定即可在所测目标上恢复训练时态。它还揭示了模式依赖的下游影响:虽然漂移可促进工具化持续,但在无工具聊天中则破坏格式约束并膨胀输出长度。总体而言,ContextEcho 为研究者和部署者提供了开源框架,以审计模型交付时的初始人格是否在会话结束时呈现给用户,适用于聊天完成 API 目标且无需重新训练。
引用
@article{arxiv.2605.24279,
title = {ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions},
author = {Xianzhong Ding and Yangyang Yu and Changwei Liu and Bill Zhao},
journal= {arXiv preprint arXiv:2605.24279},
year = {2026}
}