通过生成式增强从众包中改进学习
机器学习
2021-07-23 v1 计算机视觉与模式识别
人机交互
摘要
众包为监督式机器学习提供了一种高效的标签收集模式。然而,为控制标注成本,众包数据中的每个样本通常仅由少量标注者标注。这造成了稀疏性问题,并限制了在此类数据上训练的机器学习模型的质量。本文研究如何利用数据增强处理众包数据中的稀疏性。具体而言,我们提出通过增强原始稀疏标注来直接学习分类器。我们利用生成对抗网络(Generative Adversarial Networks, GAN)实现高质量增强的两个原则:1) 生成的标注应遵循真实标注的分布,由判别器度量;2) 生成的标注应与真实标签具有高互信息,由辅助网络度量。在三个真实世界数据集上针对一系列最先进的学习自众包方法的广泛实验与比较证明了我们数据增强框架的有效性。它展示了我们的算法在一般低预算众包中的潜力。
引用
@article{arxiv.2107.10449,
title = {Improve Learning from Crowds via Generative Augmentation},
author = {Zhendong Chu and Hongning Wang},
journal= {arXiv preprint arXiv:2107.10449},
year = {2021}
}
备注
KDD 2021