中文

从含噪众包数据到监督式机器学习模型的端到端学习

机器学习 2020-11-16 v1

摘要

标注真实世界数据集耗时但却是监督式机器学习模型所不可或缺的。一种常见方案是通过众包将标注任务分发给大量非专家工人。由于众包工人背景与经验各异,所获标签极易出错,甚至损害学习模型。本文主张利用混合智能(即结合深度模型与人类专家)来设计一种从含噪众包数据、尤其在在线场景下的端到端学习框架。我们首先总结应对非专家众包噪声标签及多标注者学习挑战的现有最优方案。我们展示标签聚合如何借助标注者混淆矩阵的估计来裨益学习过程。此外,借助专家标注者及分类器,我们清洗高信息量样本的聚合标签以提升最终分类精度。我们在若干图像数据集(即 UCI 与 CIFAR-10)上用 SVM 与深度神经网络验证了策略的有效性。评估显示,带混淆矩阵估计的在线标签聚合将标签错误率降低逾 30%。进而,仅用专家结果重标 10% 的数据,配合 SVM 即达逾 90% 分类精度。

关键词

引用

@article{arxiv.2011.06833,
  title  = {End-to-End Learning from Noisy Crowd to Supervised Machine Learning Models},
  author = {Taraneh Younesian and Chi Hong and Amirmasoud Ghiassi and Robert Birke and Lydia Y. Chen},
  journal= {arXiv preprint arXiv:2011.06833},
  year   = {2020}
}