中文

何为优秀的终端智能体基准任务:对抗性、困难性与可读性评估设计指南

人工智能 2026-05-01 v1

摘要

终端智能体基准已成为衡量大语言模型编码与系统管理能力的主要信号。随着评估环境市场的增长,快速发布任务的压力也随之而来,而这些任务往往未经对验证逻辑的彻底对抗性审查。本文是一份编写优秀基准任务的指南,源自一年多来为 Terminal Bench 贡献和评审任务的经验。大多数人编写基准任务的方式与他们编写提示词的方式相同。他们不应该这样做。提示词旨在帮助智能体成功;而基准旨在查明它是否能够成功。我们认为,优秀的任务具有对抗性、困难性和可读性,并且一大类常见的失败模式——AI 生成的指令、过度规定性的规范、文书性困难、假设隐藏知识的预言机解决方案、验证错误内容的测试以及可被奖励攻击的环境——都是将任务创作视为提示词创作的可预见后果。我们分类了这些失败模式,论证了真正的困难是概念性的而非环境性的,并讨论了近期的实证证据,表明在流行的终端智能体基准中,超过 15% 的任务是可被奖励攻击的。我们希望这能为基准维护者、任务贡献者以及使用基准分数作为证据的研究人员提供有用的参考。

关键词

引用

@article{arxiv.2604.28093,
  title  = {What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design},
  author = {Ivan Bercovich},
  journal= {arXiv preprint arXiv:2604.28093},
  year   = {2026}
}