中文

可变工作量众包的难题及可见金标准的作用

人机交互 2021-11-16 v1

摘要

我们考虑一类可变工作量的人类标注任务,其中每项所需标签数量可能差异巨大(例如,找出图像中所有人脸、文本中的命名实体、音频录音中的鸟鸣等)。在此类任务中,某些项所需的标注工作量远多于其他项。此外,每项标注工作量在该项被标注后才可知,因为确定所需标签数量是标注任务本身的隐含部分。在一个由众包标注者完成的图像边界框任务上,我们表明标注者准确率和召回率随工作量增加持续下降。我们推测了该下降的原因并研究了一系列抵消它的方法。首先,我们在此任务上基准测试了一组高质量众包的通用最佳实践方法。值得注意的是,其中仅有一种方法真正提升了质量:使用可见金标准问题,在工作者工作过程中就其准确率提供周期性反馈。鉴于这些有前景的结果,我们随后研究并评估了可见金标准方法的若干变体,带来了进一步改进。最终结果显示边界框准确率较基线提升 7%。我们讨论了可见金标准方法的通用性及未来研究的有前景方向。

关键词

引用

@article{arxiv.2105.09457,
  title  = {The Challenge of Variable Effort Crowdsourcing and How Visible Gold Can Help},
  author = {Danula Hettiachchi and Mike Schaekermann and Tristan McKinney and Matthew Lease},
  journal= {arXiv preprint arXiv:2105.09457},
  year   = {2021}
}

备注

25 pages, To appear in the Proceedings of the ACM on Human-Computer Interaction, CSCW 2021