AI 评估的范式:目标、方法论与文化的映射
人工智能
2025-06-09 v2 机器学习
摘要
AI 评估研究日益复杂且跨学科,吸引了来自不同背景和目标的研究者。因此,出现了各种各异的评估范式,往往在孤立中发展,采用冲突的术语,忽视彼此的贡献。这种碎片化导致研究轨迹封闭,不同范式之间以及与一般大众之间的沟通障碍增加,最终导致部署的 AI 系统未能达到预期。为帮助弥合这种孤立性,本文调查了 AI 评估领域的最新工作,识别出六大主要范式。我们在与每个范式相关的关键维度上(包括目标、方法论和研究文化)概述了主要的最新贡献。通过阐明每个范式特有的提问和方法,我们旨在提高人们对当前评估方法广度的 awareness,并促进不同范式之间的交叉融合。我们还识别了该领域的潜在空白,以激发未来研究方向。
引用
@article{arxiv.2502.15620,
title = {Paradigms of AI Evaluation: Mapping Goals, Methodologies and Culture},
author = {John Burden and Marko Tešić and Lorenzo Pacchiardi and José Hernández-Orallo},
journal= {arXiv preprint arXiv:2502.15620},
year = {2025}
}
备注
Accepted at IJCAI 2025 Survey Track