探讨众包中的标注者群体偏差
人机交互
2021-10-18 v1 机器学习
摘要
众包已成为收集标注数据以训练监督机器学习模型的一种流行方法。然而,标注者偏差可能导致有缺陷的标注。尽管已有少数工作研究了个体标注者偏差,但标注者中的群体效应在很大程度上被忽视。在本工作中,我们揭示了同一人口统计学群体内的标注者在标注任务中往往表现出一致的群体偏差,因此我们对标注者群体偏差进行了初步研究。我们首先在各种真实世界的众包数据集中实证验证了标注者群体偏差的存在。然后,我们开发了一种新颖的概率图框架 GroupAnno,通过一种新的扩展期望最大化(EM)训练算法来捕捉标注者群体偏差。我们在合成数据集和真实世界数据集上进行了实验。实验结果表明,与具有竞争力的基线相比,我们的模型在标签聚合和模型学习的标注者群体偏差建模方面是有效的。
引用
@article{arxiv.2110.08038,
title = {Toward Annotator Group Bias in Crowdsourcing},
author = {Haochen Liu and Joseph Thekinen and Sinem Mollaoglu and Da Tang and Ji Yang and Youlong Cheng and Hui Liu and Jiliang Tang},
journal= {arXiv preprint arXiv:2110.08038},
year = {2021}
}
备注
10 pages