中文

立场:AI 竞赛为生成式 AI 评估中的实证严谨性提供黄金标准

人工智能 2025-05-30 v2

摘要

在这篇立场论文中,我们观察到生成式 AI 中的实证评估正处于危机点,因为传统的机器学习评估和基准测试策略不足以满足评估现代生成式 AI 模型和系统的需求。造成这种情况的原因有很多,包括这些模型通常具有几乎无界的输入和输出空间,通常没有明确定义的真值目标,并且通常基于先前模型输出的上下文表现出强烈的反馈循环和预测依赖性。除了这些关键问题之外,我们认为泄漏和污染问题实际上是生成式 AI 评估中最重要且最难以解决的问题。有趣的是,AI 竞赛领域已经制定了有效的措施和实践来对抗泄漏,以在竞赛环境中遏制不良行为者的作弊行为。这使得 AI 竞赛成为一个特别有价值(但未被充分利用)的资源。现在是该领域将 AI 竞赛视为生成式 AI 评估中实证严谨性的黄金标准,并据此价值来利用和收集其结果的时候了。

关键词

引用

@article{arxiv.2505.00612,
  title  = {Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation},
  author = {D. Sculley and Will Cukierski and Phil Culliton and Sohier Dane and Maggie Demkin and Ryan Holbrook and Addison Howard and Paul Mooney and Walter Reade and Megan Risdal and Nate Keating},
  journal= {arXiv preprint arXiv:2505.00612},
  year   = {2025}
}