森林与树:机器学习评估中的 $(N, K)$ 折中
机器学习
2025-12-12 v2 人工智能
计算与语言
摘要
可重复性是科学验证及其结果权威性的基石。机器学习评估的可重复性导致更大的信任、信心和价值。然而,机器学习中常用的真实答案往往来自人类,而人类之间存在 disagreement,而 surprisingly little研究已探讨有效忽略这些 disagreement 的影响。缺乏研究的一个原因是,收集人工标注评估数据的预算有限,为每个示例获取多个评审者的更多样本会大大增加每个项目的标注成本。我们研究了在给定预算()的条件下,为可靠的机器学习评估所需的项目数量()和每个项目的响应数量()之间的折中。我们分析了一系列具有多个注释每个项目的分类数据集,以及拟合这些数据集的模拟分布,以确定给定固定预算用于收集评估数据和可靠比较机器学习模型性能的最佳 配置。我们的发现表明,首先,考虑人类 disagreement 可能在每个数据集至少测试一个指标时, 不会超过1000(且常常更低)。此外,这种最小的 几乎总是在 时发生。 Furthermore, 与 之间的折中 nature,或是否存在这种折中,取决于评估指标,对于更敏感于响应分布的指标,在更高水平的 上表现更好。我们的方法可以帮助 ML 实践者通过找到最佳指标和要收集的项目数和每个项目的注释数来获取更有效的测试数据,以获得最可靠的预算。
引用
@article{arxiv.2508.03663,
title = {Forest vs Tree: The $(N, K)$ Trade-off in Reproducible ML Evaluation},
author = {Deepak Pandita and Flip Korn and Chris Welty and Christopher M. Homan},
journal= {arXiv preprint arXiv:2508.03663},
year = {2025}
}
备注
Accepted at AAAI-26