十二篇 LLM 代理基准论文自我披露情况:一次试点审计与开放评分方案
机器学习
2026-05-21 v1
摘要
我们阅读了十二篇著名的 LLM 代理基准论文,逐维度记录每篇论文实际说明其评估如何运行的情况。其动机源于常见的挫折感:两篇论文将相同基准、相同模型名称报告结果,却产生分歧,而你无法弄清原因——是 scaffold、采样设置、子集,或是评估器版本。在许多情况下,已发布的制品无法让人解答。本文是关于尝试的实现报告。我们设计了小型审计方案(五个维度:基准身份、 harness 规格、推理设置、成本报告、失败分解),编写了带有我们在试点评分中遇到的边界情况的评分编码表,对十二篇经典论文(八篇代理类、四篇经典静态类)进行评分并记录观察结果。我们对代理运行的披露进行评分,而非其正确性,不声称披露等同于可信结果。八篇代理类基准论文的平均审计得分为 0.38(满分 1.0),四篇经典静态基准为 0.66;最大差距在成本(八篇代理类基准论文均未以任何形式披露推理成本)和 harness 规格(八篇代理类基准论文均未完全披露内容寻址容器镜像的评估环境)。我们以 JSON Schema 文件形式发布该方案,以 Markdown 文档形式发布编码表,以 CSV 格式发布原始评分表。该评分由单一审计员一次通过完成;多评估员审计是自然的下一步,我们讨论了其可能影响。
引用
@article{arxiv.2605.21404,
title = {What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema},
author = {Mahdi Naser Moghadasi and Faezeh Ghaderi},
journal= {arXiv preprint arXiv:2605.21404},
year = {2026}
}
备注
Pilot audit of 12 LLM agent benchmark papers; schema, codebook, and per-paper scoring sheet released. Submission to IEEE Big Data 2026