中文

AI 评估的范式:目标、方法论与文化的映射

人工智能 2025-06-09 v2 机器学习

摘要

AI 评估研究日益复杂且跨学科,吸引了来自不同背景和目标的研究者。因此,出现了各种各异的评估范式,往往在孤立中发展,采用冲突的术语,忽视彼此的贡献。这种碎片化导致研究轨迹封闭,不同范式之间以及与一般大众之间的沟通障碍增加,最终导致部署的 AI 系统未能达到预期。为帮助弥合这种孤立性,本文调查了 AI 评估领域的最新工作,识别出六大主要范式。我们在与每个范式相关的关键维度上(包括目标、方法论和研究文化)概述了主要的最新贡献。通过阐明每个范式特有的提问和方法,我们旨在提高人们对当前评估方法广度的 awareness,并促进不同范式之间的交叉融合。我们还识别了该领域的潜在空白,以激发未来研究方向。

关键词

引用

@article{arxiv.2502.15620,
  title  = {Paradigms of AI Evaluation: Mapping Goals, Methodologies and Culture},
  author = {John Burden and Marko Tešić and Lorenzo Pacchiardi and José Hernández-Orallo},
  journal= {arXiv preprint arXiv:2502.15620},
  year   = {2025}
}

备注

Accepted at IJCAI 2025 Survey Track