众包标注:综述
人工智能
2014-09-04 v3
摘要
近年来,基于众包的人类计算研究项目数量激增。多项选择(或标注)问题可以被视为通过该方法解决的一种常见问题类型。作为一种应用,众包标注被用于为大型机器学习数据集寻找真实标签。由于众包人员不一定是专家,他们提供的标签往往存在噪声和错误。这一挑战通常通过为每个样本收集多个标签,然后将其聚合以估计真实标签来解决。尽管该机制能产生高质量的标签,但实际上并不具备成本效益。因此,目前的研究致力于在固定获取标签数量的前提下,最大化真实标签估计的准确性。本文综述了聚合冗余众包标签以估计未知真实标签的方法。它提出了一个统一的统计隐变量模型,该领域中现有流行方法之间的差异对应于模型参数的不同选择。随后,综述了在这些模型上进行推断的算法。此外,还讨论了基于先前收集的标签和估计模型迭代收集标签的自适应方法。另外,本文还比较了这些杰出方法,并为解决当前开放问题所需的未来工作提供了指导方针。
引用
@article{arxiv.1301.2774,
title = {Crowd Labeling: a survey},
author = {Jafar Muhammadi and Hamid Reza Rabiee and Abbas Hosseini},
journal= {arXiv preprint arXiv:1301.2774},
year = {2014}
}
备注
Under consideration for publication in Knowledge and Information Systems