中文

Max-MIG:一种用于众包联合学习的信息论方法

机器学习 2019-06-04 v1 人机交互 信息论 math.IT 机器学习

摘要

从众包中获取标签是获得大规模标注数据的潜在途径。尽管已开发多种从众包中学习的方法,一个关键挑战仍未解决:\emph{在事先不知晓众包间信息结构的情况下从众包中学习,而其中部分人员会做出高度相关的错误标注,另一些人则草率标注(例如随机标注)}。我们提出一种信息论方法 Max-MIG,用于众包联合学习,基于一个常见假设:在给定真实标签的条件下,众包标签与数据相互独立。Max-MIG 同时聚合众包标签并学习准确的数据分类器。此外,我们设计了一个准确的数据-众包预测器,利用数据和众包标签来预测真实标签。据我们所知,这是首个解决上述众包学习挑战的算法。除理论验证外,我们还通过实证表明,我们的算法在大多数设定(包括真实世界数据)下取得了新的 SOTA 结果,并且是首个对各种信息结构具有鲁棒性的算法。代码见 \hyperlink{https://github.com/Newbeeer/Max-MIG}{https://github.com/Newbeeer/Max-MIG}

关键词

引用

@article{arxiv.1905.13436,
  title  = {Max-MIG: an Information Theoretic Approach for Joint Learning from Crowds},
  author = {Peng Cao and Yilun Xu and Yuqing Kong and Yizhou Wang},
  journal= {arXiv preprint arXiv:1905.13436},
  year   = {2019}
}

备注

Accepted by ICLR2019