中文

从多标注者序数数据推断真实值:一种概率方法

机器学习 2013-05-02 v1 机器学习

摘要

众包是大规模数据标注任务的一种流行方法,其中每个数据点由多个带有噪声的标注者进行标记。我们考虑从具有不同且未知专业水平的多个标注者获得的噪声序数标签中推断真实值的问题。针对序数数据的标注模型大多作为其二元/分类对应模型的扩展而被提出,且在众包文献中受到的关注较少。我们提出了一种新的众包序数数据模型,该模型考虑了实例难度以及标注者专业水平,并推导了用于参数估计的变分贝叶斯推断算法。我们分析了几种针对二元/分类标签的最先进标注者模型的序数扩展,并在两个包含通过 Amazon Mechanical Turk 收集的序数查询 -URL 相关性分数的真实世界数据集上评估了所有模型的性能。结果表明,所提出的模型表现优于或等同于现有的最先进方法,并且相比于均值、中位数和多数投票等不考虑标注者专业水平的流行基线方法,对“垃圾”标注者(即不查看实例而随机分配标签的标注者)具有更强的抵抗力。

关键词

引用

@article{arxiv.1305.0015,
  title  = {Inferring ground truth from multi-annotator ordinal data: a probabilistic approach},
  author = {Balaji Lakshminarayanan and Yee Whye Teh},
  journal= {arXiv preprint arXiv:1305.0015},
  year   = {2013}
}