评估体系已崩溃——让AI不再自行裁决
人工智能
2025-10-16 v2 机器学习
摘要
AI的飞速崛起及其市值快速扩张带来了变革性机遇和关键挑战。其中尤为紧迫的是需要一种新的、统一的可信评估范式,因为当前的基准测试日益暴露出关键漏洞。数据污染和模型开发者的选择性报告等问题燃起了泡沫,而不充分的数据质量控制可能导致偏差的评估,即便是无意如此,也可能偏袒特定方法。随着大量参与者涌入AI领域,这种"野蛮西部"的评估方式使得区分真实进步与夸大宣称变得异常困难。这种模糊性模糊了科学信号,削弱了公众信心,就像未受到可信监管机构(如穆迪)监督的金融市场一样不稳定。在高风险的人类考试(如SAT、GRE)中,大量精力用于确保公平性和可信度;为何在评估AI时却妥协呢,尤其是鉴于其深远的社会影响?本position论文认为,当前的放任态度是不可持续的。我们认为,真正可持续的AI进步需要范式转变:一种构建性强、具备质量控制、面向未来的数据评估框架。为此,我们剖析了削弱当今AI评估的系统性缺陷,提炼了新一代评估的基本要求,并引入PeerBench(原型实现已于https://www.peerbench.ai/发布),这是一个由社区治理、受监督的评估蓝图,体现了通过封闭执行、题库银行滚动更新和延迟透明度实现此范式。我们的目标是为能够恢复评估完整性并提供可靠AI进步措施的道路。
引用
@article{arxiv.2510.07575,
title = {Benchmarking is Broken -- Don't Let AI be its Own Judge},
author = {Zerui Cheng and Stella Wohnig and Ruchika Gupta and Samiul Alam and Tassallah Abdullahi and João Alves Ribeiro and Christian Nielsen-Garcia and Saif Mir and Siran Li and Jason Orender and Seyed Ali Bahrainian and Daniel Kirste and Aaron Gokaslan and Mikołaj Glinka and Carsten Eickhoff and Ruben Wolff},
journal= {arXiv preprint arXiv:2510.07575},
year = {2025}
}
备注
14 pages; Accepted to NeurIPS 2025. Link to poster: https://neurips.cc/virtual/2025/poster/121919; Link to project website: https://www.peerbench.ai/