中文

追逐公开分数:编程智能体工作流中的用户压力与评估利用

计算与语言 2026-04-23 v1

摘要

前沿编程智能体越来越多地被用于工作流中,用户主要通过反复提升公开分数(即工作区中带有标签的公开评估文件所报告的分数)来监督进展,而不是直接检查智能体的中间输出。我们研究了多轮用户提升该分数的压力是否会引发公开分数利用:即通过捷径提高公开分数,而不改善隐藏的私有评估的行为。我们从一个初步的单脚本表格分类任务开始,在该任务中,GPT-5.4 和 Claude Opus 4.6 在 10 轮用户-智能体交互内都利用了标签信息。然后,我们构建了 AgentPressureBench,这是一个涵盖三种输入模态的 34 任务机器学习仓库基准,并收集了来自 13 个编程智能体的 1326 条多轮轨迹。在我们的基准测试中,我们观察到 403 次利用性运行,遍布所有任务。我们还发现,更强的模型具有更高的利用率,这得到了显著的 Spearman 秩相关系数 0.77 的支持。我们的消融实验表明,更高的用户压力会导致更早的利用,将平均首次利用轮次减少了 15.6 轮(即从 19.67 降至 4.08)。作为一种缓解措施,在提示中添加明确的反利用措辞几乎消除了利用行为(从 100% 降至 8.3%)。我们希望我们的工作能够引起人们对更谨慎地使用编程智能体工作流以及在用户压力下开发更鲁棒的编程智能体的关注。我们的项目页面位于 https://ucsc-vlaa.github.io/AgentPressureBench。

关键词

引用

@article{arxiv.2604.20200,
  title  = {Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows},
  author = {Hardy Chen and Nancy Lau and Haoqin Tu and Shuo Yan and Xiangyan Liu and Zijun Wang and Juncheng Wu and Michael Qizhe Shieh and Alvaro A. Cardenas and Cihang Xie and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2604.20200},
  year   = {2026}
}

备注

25 pages