用于训练深度神经网络的特征相关伪噪声的生成与分析
机器学习
2021-05-25 v1
摘要
在带噪声标签的数据集上训练深度神经网络(DNNs)是一个具有挑战性的问题,因为在错误标注样本上学习会降低网络性能。由于真实世界噪声数据集的可用真值有限,先前论文通过随机修改干净数据集训练样本的标签来创建合成噪声数据集。然而,仅使用这种随机噪声无法得出最终结论,因为它排除了特征相关噪声。因此,有必要生成额外提供真值信息的特征相关噪声数据集。为此,我们提出一种直观的方法,利用 DNNs 在保留真实标签信息的干净数据集上的训练预测来创建特征相关噪声数据集。我们将这些数据集称为“伪噪声数据集(Pseudo Noisy datasets)”。我们进行了若干实验,以证明伪噪声数据集在不同条件下类似于特征相关噪声数据集。我们进一步随机生成具有与伪噪声相同噪声分布的合成噪声数据集(称为“随机化噪声(Randomized Noise)”),以经验性地表明:i)与随机噪声相比,在特征相关标签噪声下学习更容易;ii)无论噪声分布如何,伪噪声数据集都能模拟特征相关标签噪声;iii)当前的训练方法不能推广到特征相关标签噪声。因此,我们认为伪噪声数据集将有助于研究和开发鲁棒的训练方法。
引用
@article{arxiv.2105.10796,
title = {Generation and Analysis of Feature-Dependent Pseudo Noise for Training Deep Neural Networks},
author = {Sree Ram Kamabattula and Kumudha Musini and Babak Namazi and Ganesh Sankaranarayanan and Venkat Devarajan},
journal= {arXiv preprint arXiv:2105.10796},
year = {2021}
}