BenchGuard:谁在守护基准?LLM 代理基准的自动化审计
计算与语言
2026-04-29 v1 人工智能
软件工程
摘要
随着基准测试的复杂度不断提升,许多看似的代理失败实际上并非代理本身的错误,而是基准本身的错误:损坏的规范、隐含假设以及对有效替代方法进行惩罚的僵化评估脚本。我们提出采用前沿 LLM 作为评估基础设施的系统审计员,并通过 BenchGuard 实现了这一愿景——首个针对任务导向、基于执行的代理基准的自动化审计框架。BenchGuard 通过结构化的 LLM 协议对所有基准制品进行交叉验证,可选纳入代理解决方案或执行痕迹作为额外的诊断证据。在两大突出科学基准上部署后,BenchGuard 发现了 ScienceAgentBench 中的 12 项作者确认的问题——包括使任务不可解决的致命错误——并在 BIXBench Verified-50 子集上捕获了 83.3% 的专家识别问题,甚至捕获了先前人工审查完全忽略的缺陷。对 50 项复杂生物信息学任务进行完整审计的成本不足美元 15 元,使自动化基准审计成为实用且有价值的补充手段。这些发现指向 AI 辅助的基准开发,前沿模型不仅是评估对象,更是评估基础设施本身验证的积极参与者。
引用
@article{arxiv.2604.24955,
title = {BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks},
author = {Xinming Tu and Tianze Wang and Yingzhou and Lu and Kexin Huang and Yuanhao Qu and Sara Mostafavi},
journal= {arXiv preprint arXiv:2604.24955},
year = {2026}
}