中文

带难度的众包:面向异质性项目的贝叶斯评分模型

机器学习 2024-10-23 v2 机器学习

摘要

在应用统计和机器学习中,用于训练的“金标准”往往有偏且几乎总是有噪声。Dawid和Skene的众包模型(合理流行)调整了评分者(编码者、标注者)的敏感性和特异性,但未能捕捉到为训练收集的评分数据的分布特性,这反过来又使训练产生偏差。在本研究中,我们引入了一个通用的测量误差模型,通过添加项目级别的难度、区分度和可猜测性效应,我们可以推断出共识类别。我们进一步展示了如何约束这些模型的双峰后验,以避免(或在必要时允许)对抗性评分者。我们通过后验预测检验(贝叶斯版本的χ²检验)验证了模型的拟合优度。Dawid和Skene的模型被拟合优度检验拒绝,而我们调整了项目异质性的新模型则未被拒绝。我们用两个经过充分研究的数据集(牙科X光片中龋齿的二值评分数据和自然语言中的蕴含关系)来说明我们的新模型。

关键词

引用

@article{arxiv.2405.19521,
  title  = {Crowdsourcing with Difficulty: A Bayesian Rating Model for Heterogeneous Items},
  author = {Seong Woo Han and Ozan Adıgüzel and Bob Carpenter},
  journal= {arXiv preprint arXiv:2405.19521},
  year   = {2024}
}