衡量前沿AI能力的开放世界评估
人工智能
2026-05-21 v1
摘要
基于基准的评估仍然是跟踪前沿AI进展的重要手段,但它可能高估或低估已部署能力,因为它优选可精确指定、自动评分、易优化且在低预算和短时间范围内运行的任务。在本文中,我们提出一种互补评估类别,称为开放世界评估:长期视角、复杂乱序的真实世界任务,通过小样本定性分析进行评估,而非规模化自动化。在本文中,我们调查了最近的开放世界评估,确定其优势与局限性,并引入CRUX(Collaborative Research for Updating AI eXpectations),用于定期开展此类评估。作为首个实例,我们让AI代理开发并发布一个简单的iOS应用程序至Apple App Store。该代理仅通过一次不可避免的手动干预即可完成该任务,表明开放世界评估可为即将广泛可见的能力提供早期警示。我们结论性地提出关于设计和报告开放世界评估的建议。
引用
@article{arxiv.2605.20520,
title = {Open-World Evaluations for Measuring Frontier AI Capabilities},
author = {Sayash Kapoor and Peter Kirgis and Andrew Schwartz and Stephan Rabanser and J. J. Allaire and Rishi Bommasani and Harry Coppock and Magda Dubois and Gillian K Hadfield and Andrew B. Hall and Sara Hooker and Seth Lazar and Steve Newman and Dimitris Papailiopoulos and Shoshannah Tekofsky and Helen Toner and Cozmin Ududec and Arvind Narayanan},
journal= {arXiv preprint arXiv:2605.20520},
year = {2026}
}