中文

我们能信任 AI 基准测试吗?关于 AI 评估当前问题的跨学科综述

人工智能 2025-05-27 v2

摘要

量化人工智能 (AI) 基准测试已成为评估 AI 模型和系统性能、能力和安全性的基本工具。目前,这些基准测试正在塑造 AI 开发的方向,并在监管框架中发挥越来越重要的作用。然而,随着其影响力的增长,也担忧它们如何以及以何种效果评估高度敏感的话题,如能力(包括高影响能力)、安全性和系统风险。本文提出了一项关于约 100 项关于定量基准测试实践不足之处的跨学科元综述,涵盖过去 10 年出版的研究。这一综述将许多关于基准测试设计和应用中细致问题(如数据集创建中的偏见、文档不充分、数据污染以及未能区分信号与噪声)与更广泛的社会技术问题(如过度关注根据单次测试逻辑评估基于文本的 AI 模型,这种逻辑未能考虑 AI 模型日益增多的多模态性以及其与人类和其他技术系统的交互)相结合。我们的综述还指出了当前基准测试实践中的一系列系统性缺陷,如激励 misalignment、construct validity 问题、unknown unknowns 以及基准测试结果作弊问题。此外,它还强调基准测试实践根本上受到文化、商业和竞争动态的影响,这些动态常常优先考虑最新性能,而牺牲更广泛的社会关切。通过概述现有基准测试程序所面临的风险,我们对置放大对基准测试信任的程度提出了质疑,并为改进量化 AI 基准测试在现实场景复杂性中的可解释性和相关性贡献了努力。

关键词

引用

@article{arxiv.2502.06559,
  title  = {Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation},
  author = {Maria Eriksson and Erasmo Purificato and Arman Noroozian and Joao Vinagre and Guillaume Chaslot and Emilia Gomez and David Fernandez-Llorca},
  journal= {arXiv preprint arXiv:2502.06559},
  year   = {2025}
}

备注

Under review as conference paper