对使用错误标注训练数据训练神经网络的新理解
机器学习
2019-09-23 v1 机器学习
摘要
我们研究了使用错误标注训练数据进行机器学习的问题。我们试图通过分析表征该问题的基本模型和方程,来更好地理解错误标注训练的影响。这包括关于含噪模型做出与干净模型相同决策的能力以及噪声对模型性能影响的结果。除了提供更深入的见解外,我们还能够证明,噪声模型参数的最大似然(ML)估计决定了干净模型的参数。这一性质是通过利用最大似然不变性获得的,并引出了一种在训练数据被错误标注时开发分类器的方法:即在噪声数据上训练分类器,并根据噪声水平和/或类别先验调整决策阈值。我们展示了我们处理错误标注训练的方法如何应用于多层感知器(MLPs)。
引用
@article{arxiv.1909.09136,
title = {Towards a New Understanding of the Training of Neural Networks with Mislabeled Training Data},
author = {Herbert Gish and Jan Silovsky and Man-Ling Sung and Man-Hung Siu and William Hartmann and Zhuolin Jiang},
journal= {arXiv preprint arXiv:1909.09136},
year = {2019}
}
备注
13 pages with 3 figures