关于 Mixup 训练:深度神经网络校准与预测不确定性的改进
机器学习
2020-01-08 v5 机器学习
摘要
Mixup~\cite{zhang2017mixup} 是最近提出的一种深度神经网络训练方法,在训练期间通过随机配对图像及其关联标签的凸组合生成额外样本。尽管实现简单,它已被证明是一种出奇有效的图像分类数据增强方法:用 mixup 训练的 DNN 在若干图像分类基准上显示出明显的分类性能提升。在本工作中,我们讨论了一个迄今未被触及的 mixup 训练方面——用 mixup 训练的模型的校准与预测不确定性。我们发现,用 mixup 训练的 DNN 比常规方式训练的 DNN 校准显著更好——即预测的 softmax 分数能更好指示正确预测的实际似然。我们在若干图像分类架构和数据集(包括 ImageNet 等大规模数据集)上进行实验,发现情况确实如此。此外,我们发现仅混合特征不会带来相同的校准收益,且 mixup 训练中的标签平滑在改善校准中起重要作用。最后,我们还观察到 mixup 训练的 DNN 对分布外和随机噪声数据上过度自信的预测更不敏感。我们得出结论,神经网络中典型的过度自信,即便在分布内数据上,也可能是使用硬标签训练的后果,这表明在预测不确定性为重要关切的分类任务中应采用 mixup。
引用
@article{arxiv.1905.11001,
title = {On Mixup Training: Improved Calibration and Predictive Uncertainty for Deep Neural Networks},
author = {Sunil Thulasidasan and Gopinath Chennupati and Jeff Bilmes and Tanmoy Bhattacharya and Sarah Michalak},
journal= {arXiv preprint arXiv:1905.11001},
year = {2020}
}
备注
NeurIPS 2019