中文

基于众包数据的深度学习

机器学习 2017-12-27 v2 计算机视觉与模式识别 人机交互 机器学习

摘要

在过去几年中,深度学习通过大幅改进各领域的当前最优(state-of-the-art),彻底改变了机器学习领域。然而,随着监督式人工神经网络的规模增大,通常对更大型标注数据集的需求也随之增长。近来,众包已确立为一种以可扩展方式标注大型数据集的高效且经济高效的解决方案,但它常常需要聚合来自具有不同专业水平的多个噪声贡献者的标签。在本文中,我们解决从众包中学习深度神经网络的问题。我们首先描述了一个 EM 算法,用于联合学习网络参数与标注者的可靠性。然后,提出了一种新颖的通用众包层(crowd layer),其允许我们仅使用反向传播,直接从多个标注者的噪声标签端到端地训练深度神经网络。我们通过实验表明,所提方法能够在内部捕获不同标注者的可靠性与偏差,并在不同设定(即分类、回归与序列标注)下的各种众包数据集上取得新的 state-of-the-art 结果。

关键词

引用

@article{arxiv.1709.01779,
  title  = {Deep learning from crowds},
  author = {Filipe Rodrigues and Francisco Pereira},
  journal= {arXiv preprint arXiv:1709.01779},
  year   = {2017}
}

备注

10 pages, The Thirty-Second AAAI Conference on Artificial Intelligence (AAAI), 2018