中文

超越任务完成:通过程序感知评估揭示 LLM 代理中的失效成功

人工智能 2026-03-04 v1

摘要

大语言模型(LLM)代理正日益被采纳于高风险场景,但当前基准主要评估任务是否完成,而非完成方式。我们引入程序感知评估(PAE)框架,将代理程序建模为结构化观察,并暴露代理观察、沟通与执行之间的一致性关系。PAE 沿多个互补轴向(效用、效率、交互质量、程序完整性)进行评估,并应用多维门控机制对结果进行分类性排除。对 tau-bench 上领先的 LLM 代理进行评估后,得出了轴向、合规性和基准层面的发现。在轴向层面,多个维度捕获非冗余的失效模式:效用掩盖了可靠性差距,速度不等于精度,简洁性不预测意图遵从。在程序合规性层面,27%~78% 的基准报告成功均为隐藏违规的失效成功。进一步地,门控显著压缩 Pass^4 通过率并影响模型排名。对失效成功案例的分析揭示了 distinctive per-model 失效特征:GPT-5 在政策、执行和意图维度上扩散错误;Kimi-K2-Thinking 将78%的违规集中在政策忠诚与合规方面;Mistral-Large-3 则以忠诚性失效为主导。在基准层面,我们的分析暴露了基准设计的结构性缺陷,包括任务范围缺口、矛盾的奖励信号以及仿真器工伤产生成意外成功。

关键词

引用

@article{arxiv.2603.03116,
  title  = {Beyond Task Completion: Revealing Corrupt Success in LLM Agents through Procedure-Aware Evaluation},
  author = {Hongliu Cao and Ilias Driouich and Eoin Thomas},
  journal= {arXiv preprint arXiv:2603.03116},
  year   = {2026}
}