Max-MIG:一种用于众包联合学习的信息论方法
机器学习
2019-06-04 v1 人机交互
信息论
math.IT
机器学习
摘要
从众包中获取标签是获得大规模标注数据的潜在途径。尽管已开发多种从众包中学习的方法,一个关键挑战仍未解决:\emph{在事先不知晓众包间信息结构的情况下从众包中学习,而其中部分人员会做出高度相关的错误标注,另一些人则草率标注(例如随机标注)}。我们提出一种信息论方法 Max-MIG,用于众包联合学习,基于一个常见假设:在给定真实标签的条件下,众包标签与数据相互独立。Max-MIG 同时聚合众包标签并学习准确的数据分类器。此外,我们设计了一个准确的数据-众包预测器,利用数据和众包标签来预测真实标签。据我们所知,这是首个解决上述众包学习挑战的算法。除理论验证外,我们还通过实证表明,我们的算法在大多数设定(包括真实世界数据)下取得了新的 SOTA 结果,并且是首个对各种信息结构具有鲁棒性的算法。代码见 \hyperlink{https://github.com/Newbeeer/Max-MIG}{https://github.com/Newbeeer/Max-MIG}
引用
@article{arxiv.1905.13436,
title = {Max-MIG: an Information Theoretic Approach for Joint Learning from Crowds},
author = {Peng Cao and Yilun Xu and Yuqing Kong and Yizhou Wang},
journal= {arXiv preprint arXiv:1905.13436},
year = {2019}
}
备注
Accepted by ICLR2019