可靠显著性测试每个物品所需的评分数量
机器学习
2026-01-30 v3
摘要
机器学习评估的基石是(常被忽视的)假设模型和人类响应足够可靠,以便通过准确率、精确率和召回率等简单指标对模型进行评估。生成式 AI 革命似乎会使这一假设失效,因其关键作用正在发生随机推断。然而,尽管公众对 AI 透明度有浓厚需求,并且已有强有力的证据表明人类是不可靠的评判者,但对模型可靠性的估计仍通常仅基于每个输入项目的最少几个输出响应。我们采用一种以前用于评估各种指标和估计量可靠性的方法,用于确定(现有或计划中的)数据集是否具有足够的响应数以确保可靠的零假设统计测试。我们表明,对于许多常见指标,仅收集 5-10 个每个项目的响应(来自每个模型和人类评估团队)就不足够。我们应用我们的方法于几个极少数具有多个分解响应 per 项目的黄金标准测试集中,甚至这些数据集也不足够每个项目的响应。我们展示了我们的方法如何帮助 AI 研究人员更好地决定如何收集 AI 评估的数据。
引用
@article{arxiv.2412.02968,
title = {How Many Ratings per Item are Necessary for Reliable Significance Testing?},
author = {Christopher Homan and Flip Korn and Deepak Pandita and Chris Welty},
journal= {arXiv preprint arXiv:2412.02968},
year = {2026}
}
备注
Accepted at EACL Findings 2026