大海捞针:MTurk 摘要任务中高一致性标注者的分析
计算与语言
2023-06-16 v3
摘要
为避免在低质量标注上浪费昂贵且低效的资源,我们需要一种方法来建立可靠的标注者库,使其能够有效完成诸如评估自动摘要等困难任务。因此,我们通过两步流程研究了高质量 Amazon Mechanical Turk 工作者的招募。结果表明,我们能够在标注者执行评估之前成功过滤掉不合格者,并在类似资源约束下获得高一致性的标注。尽管我们的标注者内部及与 CloudResearch 工作者之间表现出高度共识,但他们在部分数据上与专家判断的一致性未达预期,需要进一步进行正确性培训。本文仍可作为其他具有挑战性的标注任务中招募合格标注者的最佳实践参考。
引用
@article{arxiv.2212.10397,
title = {Needle in a Haystack: An Analysis of High-Agreement Workers on MTurk for Summarization},
author = {Lining Zhang and Simon Mille and Yufang Hou and Daniel Deutsch and Elizabeth Clark and Yixin Liu and Saad Mahamood and Sebastian Gehrmann and Miruna Clinciu and Khyathi Chandu and João Sedoc},
journal= {arXiv preprint arXiv:2212.10397},
year = {2023}
}