中文

贝叶斯非参数众包

机器学习 2014-07-21 v1 应用统计

摘要

众包已被证明是标注大型数据集的有效且高效的工具。用户标注通常带有噪声,因此需要将标注组合起来以产生可靠的真实标签估计的方法。我们声称,在组合步骤中考虑用户聚类的存在可以提高性能。这在众包实施的早期阶段尤其重要,此时标注数量较少。在这个阶段,没有足够的信息来准确估计每个标注者的偏差,因此我们必须采用考虑它们之间统计联系的模型。此外,发现这些聚类本身也很有趣,因为了解标注者群体的行为可以实现有效的主动学习策略。基于此,我们在本文中提出了两种新的完全无监督模型,基于中国餐馆过程(CRP)先验和层次结构,允许联合推断这些组以及真实标签和用户属性。提出了基于辅助变量吉布斯采样的高效推理算法。最后,我们在合成和真实数据库上进行了实验,以展示我们的模型相对于最先进算法的优势。

关键词

引用

@article{arxiv.1407.5017,
  title  = {Bayesian Nonparametric Crowdsourcing},
  author = {Pablo G. Moreno and Yee Whye Teh and Fernando Perez-Cruz and Antonio Artés-Rodríguez},
  journal= {arXiv preprint arXiv:1407.5017},
  year   = {2014}
}