前沿滞后:学术 AI 评估中能力误表征的计量学审计
摘要
应用领域的 LLM 能力评估的读者想知道当前 AI 系统能够做什么。该文献回答了一个相关但 consequentially different 的问题:更老、更便宜、更少引导的模型能够做什么 (例如,2026 年的论文在 zero-shot 下评估 GPT-4o-mini,针对具备推理能力、可调用工具的前沿系统如 GPT-5.5 Pro 和 Claude Opus 4.7),常常报告稀疏的配置细节并抽象上升为关于 "AI" 的主张,这些主张通过引用、媒体和政策传播。我们测量了 "publication elicitation gap" (出版物引发差距) 在对 112,303 条 LLM 关键词匹配候选记录 (2022-01 to 2026-04; 18,574 项可接受记录,4,766 条完整论文文本可检索) 的预注册审计中,将 tested models 与当时代前沿进行比较,分别在 Epoch AI Capabilities Index (ECI)、Arena Elo 和 Artificial Analysis 下复现。中位论文评估的模型距离当时代前沿至少 10.85 ECI (~1.4 倍 Claude Sonnet 3.7 与 Claude Opus 4.5 之间的距离) (H1);探索性 rational-lag 基线 (H8) 将其分解为 ~25% 的同行评审延迟、~75% 的超额滞后。该差距以 +5.53 ECI/年的速度扩大 (H2; 95% CI [+5.03, +5.83])。与此同时,仅 3.2% 的摘要 (21.2% 的完整文本) 透露推理模式状态于推理能力模型 (H4),52.5% (95% CI [48.2, 56.9]) 声明结论层面为 "AI" 而非所评估的模型 (s),年增长率为 OR = 1.23/年。提出的补救措施包括 API 访问补贴和编辑 enforcement 要求报告框架强制要求配置表面披露 (模型快照、推理模式/努力、工具访问、脚手架、提示等);VERsIO-AI 是一个 13 项检查清单 (Core 3 desk-reject) 扩展现有框架于elicitation 表面,提供按 DOI 分析的 frontierlag.org。
引用
@article{arxiv.2605.04135,
title = {Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation},
author = {David Gringras and Misha Salahshoor},
journal= {arXiv preprint arXiv:2605.04135},
year = {2026}
}
备注
60 pages, 9 figures, 7 tables, 8 appendices. Pre-registered on OSF: https://osf.io/7xm3d/ (DOI: 10.17605/OSF.IO/7XM3D, registered 2026-04-17). Companion artefacts: VERSIO-AI v1.2 reporting checklist (Appendix A; CC-BY-4.0); frontierlag Python package (https://pypi.org/project/frontierlag/0.1.0/, MIT) and per-DOI audit tool at https://frontierlag.org