来自多个噪声标注者的可信协同标签学习
机器学习
2022-03-09 v1 人工智能
计算机视觉与模式识别
摘要
监督式深度学习依赖于海量准确标注的样本,这在许多真实场景通常是不切实际的。一个典型的替代方案是从多个噪声标注者学习。大量早期工作假设所有标签都是噪声的,而通常情况是存在少量带干净标签的可信样本。这引出了如下重要问题:我们如何有效利用少量可信数据来促进从多个标注者进行的鲁棒分类器学习?本文提出一种数据高效的方法,称为可信协同标签学习(TCL),在存在一小部分可信数据时从多个噪声标注者学习深度分类器。该方法遵循耦合视图学习的方式,联合学习数据分类器与标签聚合器。它有效利用可信数据作为引导来生成可信软标签(称为协同标签)。随后可通过交替重新标注伪标签与精炼分类器来执行协同标签学习。此外,我们进一步改进 TCL 以适用于一种特殊的完整数据情形,其中每个实例被所有标注者标注,且标签聚合器由多层神经网络表示以增强模型容量。在合成与真实数据集上的大量实验清晰地展示了所提方法的有效性与鲁棒性。源代码见 https://github.com/ShikunLi/TCL
引用
@article{arxiv.2203.04199,
title = {Trustable Co-label Learning from Multiple Noisy Annotators},
author = {Shikun Li and Tongliang Liu and Jiyong Tan and Dan Zeng and Shiming Ge},
journal= {arXiv preprint arXiv:2203.04199},
year = {2022}
}
备注
Accepted by IEEE TMM. 13 pages, 9 figures and 6 tables