中文

Crowd-Certain:众包与集成学习分类中的标签聚合

机器学习 2023-10-26 v1 计算机科学与博弈论

摘要

众包系统已被用于为计算机视觉和自然语言处理等应用积累大量标注数据。然而,由于众包标注本质上是动态且不确定的,开发一种能在大多数情况下奏效的技术极具挑战性。本文中,我们介绍 Crowd-Certain,一种用于众包和集成学习分类任务中标签聚合的新方法,针对不同数量的标注者和多种数据集,具有更优的性能和计算效率。所提方法利用标注者相对于训练分类器的一致性来确定每个标注者的可靠性分数。此外,Crowd-Certain 利用预测概率,使得训练好的分类器可在未来样本数据上复用,从而消除了现有方法中固有的反复模拟过程的需要。我们在十个不同数据集上,针对十种现有技术对我们的方法进行了广泛评估,每个数据集由不同数量的标注者标注。结果表明,Crowd-Certain 在几乎所有场景下都优于现有方法(Tao、Sheng、KOS、MACE、MajorityVote、MMSR、Wawa、Zero-Based Skill、GLAD 和 Dawid Skene),取得了更高的平均准确率、F1 分数和 AUC 率。此外,我们引入了两种现有置信度评分技术的变体。最后,我们使用两个评估指标:期望校准误差(ECE)和 Brier 分数损失,对这两种置信度评分技术进行评估。我们的结果显示,Crowd-Certain 在绝大多数被考察数据集上取得了更高的 Brier 分数和更低的 ECE,表明校准结果更优。

关键词

引用

@article{arxiv.2310.16293,
  title  = {Crowd-Certain: Label Aggregation in Crowdsourced and Ensemble Learning Classification},
  author = {Mohammad S. Majdi and Jeffrey J. Rodriguez},
  journal= {arXiv preprint arXiv:2310.16293},
  year   = {2023}
}

备注

49 pages, 5 figures