中文

CROWDLAB:利用监督学习推断多标注者数据的一致标签与质量分数

机器学习 2023-01-30 v2 人机交互 机器学习

摘要

现实世界中用于分类的数据通常由多个标注者标记。为分析此类数据,我们引入CROWDLAB,一种利用任何已训练分类器来估计的简便方法:(1)聚合可用标注得到每个样本的共识标签;(2)该共识标签正确的置信度分数;(3)量化每位标注者标签整体正确性的评分。众包中估计相关量的现有算法常依赖复杂的生成模型与迭代推断。CROWDLAB则使用直接的加权集成。现有算法常仅依赖标注者统计,忽略标注所源自样本的特征。CROWDLAB利用在这些特征上训练的任何分类器模型,从而能更好地在具有相似特征的样本间泛化。在真实世界多标注者图像数据上,我们提出的方法对(1)–(3)的估计优于Dawid-Skene/GLAD等现有算法。

关键词

引用

@article{arxiv.2210.06812,
  title  = {CROWDLAB: Supervised learning to infer consensus labels and quality scores for data with multiple annotators},
  author = {Hui Wen Goh and Ulyana Tkachenko and Jonas Mueller},
  journal= {arXiv preprint arXiv:2210.06812},
  year   = {2023}
}