基于人类标注的规范性评估:逐位评分者与评分者等价性
机器学习
2026-04-24 v3 人机交互
多智能体系统
摘要
在许多分类任务中,不存在确定的真实标签,只有可能不一致的人类判断。我们针对此类场景下出现的两个挑战:(1) 如何使用人类评分者给分类器打分,(2) 如何使用他们构建对比基准。对于第一个挑战,常见做法是将分类器与若干人类评分者组成的评估小组的多数投票进行比较。我们认为,当客观性(objectivity)或公正性(equanimity)任一性质不成立时,这种做法并不合理。相反,在适用于此类场景的效用模型下,逐位评分者打分再对评分取平均是一种更规范的方法。对于第二个挑战,我们引入评分者等价性(rater equivalence)的概念:其联合判断与分类器性能相匹配的最小人类评分者数量。我们提供了组合基准小组标签的可证明最优算法,并通过案例研究展示了该框架。
引用
@article{arxiv.2106.01254,
title = {Principled Evaluation with Human Labels: One Rater at a Time and Rater Equivalence},
author = {Paul Resnick and Yuqing Kong and Grant Schoenebeck and Tim Weninger},
journal= {arXiv preprint arXiv:2106.01254},
year = {2026}
}