中文

L_DMI:一种信息论意义上的抗噪声损失函数

机器学习 2019-11-05 v2 计算机视觉与模式识别 机器学习

摘要

大规模数据集的精确标注在时间和金钱上都非常昂贵,这是众所周知的。尽管获取低质量标注的数据集可以便宜得多,但如果不加特殊处理而直接使用此类数据集,往往会严重损害训练模型的性能。已有多种针对带噪标签学习的方法被提出。然而,大多数方法只能处理有限种类的噪声模式,需要辅助信息或步骤(例如,已知或估计噪声转移矩阵),或缺乏理论依据。本文提出一种新颖的信息论损失函数 LDMI\mathcal{L}_{DMI},用于训练对标签噪声具有鲁棒性的深度神经网络。LDMI\mathcal{L}_{DMI} 的核心是基于行列式的互信息(Determinant based Mutual Information, DMI),它是互信息的一个推广版本,不仅具有信息单调性,而且相对不变。据我们所知,LDMI\mathcal{L}_{DMI} 是首个被证明对与实例无关的标签噪声具有鲁棒性的损失函数,且不论噪声模式如何,它都可以直接应用于任何现有的分类神经网络而无需任何辅助信息。除理论依据外,我们还通过实验表明,在图像数据集和自然语言数据集(包括 Fashion-MNIST、CIFAR-10、Dogs vs. Cats、MR,涵盖多种合成噪声模式和噪声量,以及真实世界数据集 Clothing1M)的分类任务中,使用 LDMI\mathcal{L}_{DMI} 优于所有其他同类方法。代码见 https://github.com/Newbeeer/L_DMI。

关键词

引用

@article{arxiv.1909.03388,
  title  = {L_DMI: An Information-theoretic Noise-robust Loss Function},
  author = {Yilun Xu and Peng Cao and Yuqing Kong and Yizhou Wang},
  journal= {arXiv preprint arXiv:1909.03388},
  year   = {2019}
}

备注

Accepted by NeurIPS 2019