迈向基于专家评估与成对比较的鲁棒众包标注框架
人机交互
2016-07-11 v1
摘要
众包标注源于对大规模复杂数据进行标注的需求,这是一项繁琐、昂贵且耗时的任务。众包标注任务的主要挑战之一是预先控制或确定低质量/恶意标注者的比例。若该比例过高,常会出现相变,导致标注精度急剧非线性下降,正如 Karger 等人 [2014] 所指出的。为应对这些挑战,我们提出一种称为专家标签注入众包估计 (ELICE) 的新框架,并将其扩展为不同版本和变体,以延迟相变从而获得更好的标注精度。ELICE 自动结合并提升大量众包标签,这些标签由数据集中有限数量样本的专家标签所支持。专家标签有助于估计众包标注者的个体能力和每个样本的难度,二者均用于聚合标签。实证评估显示了 ELICE 相对于其他最先进方法的优越性。我们还推导了所需专家标注样本数的下界,以估计众包能力和数据集难度并获得更高质量的标签。
引用
@article{arxiv.1607.02174,
title = {Toward a Robust Crowd-labeling Framework using Expert Evaluation and Pairwise Comparison},
author = {Faiza Khan Khattak and Ansaf Salleb-Aouissi},
journal= {arXiv preprint arXiv:1607.02174},
year = {2016}
}