标签噪声表示学习综述:过去、现在与未来
机器学习
2021-02-23 v2
摘要
经典机器学习隐式地假设训练数据的标签采样自干净的分布,这对于真实场景而言可能过于严格。然而,基于统计学习的方法可能无法利用这些噪声标签鲁棒地训练深度学习模型。因此,亟需设计标签噪声表示学习(Label-Noise Representation Learning, LNRL)方法,以利用噪声标签鲁棒地训练深度模型。为了充分理解 LNRL,我们开展了一项综述研究。我们首先从机器学习的角度阐明了 LNRL 的形式化定义。随后,通过学习理论与实证研究的视角,我们厘清了噪声标签影响深度模型性能的原因。在理论指导下,我们将不同的 LNRL 方法划分为三个方向。在这一统一分类体系下,我们深入讨论了不同类别的优缺点。更重要的是,我们总结了鲁棒 LNRL 的基本组成部分,这可启发新的研究方向。最后,我们提出了 LNRL 内可能的研究方向,例如新数据集、实例依赖的 LNRL 以及对抗式 LNRL。我们还展望了 LNRL 之外的潜在方向,例如带特征噪声、偏好噪声、域噪声、相似度噪声、图噪声与示范噪声的学习。
引用
@article{arxiv.2011.04406,
title = {A Survey of Label-noise Representation Learning: Past, Present and Future},
author = {Bo Han and Quanming Yao and Tongliang Liu and Gang Niu and Ivor W. Tsang and James T. Kwok and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2011.04406},
year = {2021}
}
备注
The draft is kept updating; any comments and suggestions are welcome