k评分者可靠性:聚合人工标注应有的正确可靠性度量单位
人工智能
2022-03-25 v1 机器学习
摘要
自众包诞生以来,聚合一直是处理不可靠数据的常用策略。聚合评分比个体评分更可靠。然而,许多依赖聚合评分的自然语言处理(NLP)应用仅报告个体评分的可靠性,这是错误的分析单位。在这些情况下,数据可靠性被低估,而提出的 k评分者可靠性(kRR)应作为聚合数据集的正确数据可靠性。它是评分者间可靠性(IRR)的多评分者推广。我们对 WordSim-353 基准进行了两次复现,并给出了在 WordSim-353 上计算 kRR 的经验、解析和基于 bootstrap 的方法。这些方法产生非常相似的结果。我们希望这一讨论能促使研究者在报告 IRR 之外也报告 kRR。
引用
@article{arxiv.2203.12913,
title = {k-Rater Reliability: The Correct Unit of Reliability for Aggregated Human Annotations},
author = {Ka Wong and Praveen Paritosh},
journal= {arXiv preprint arXiv:2203.12913},
year = {2022}
}