中文

关于深度神经网络 Mixup 训练的校准

机器学习 2021-05-19 v4 机器学习

摘要

深度神经网络(DNN)在许多任务上代表当前最优水平。然而,由于其过参数化,其泛化能力受到质疑且仍是研究中领域。因此,DNN 可能过拟合并给出过度自信的预测——这些效应已被表明会影响对未见数据所赋置信度的校准。数据增强(DA)策略被提出以正则化这些模型,其中 Mixup 因能改善 DNN 的准确率、不确定性量化与校准而最为流行。但本工作中我们主张并提供经验证据:由于其基本原理,Mixup 未必改善校准。基于我们的观察,我们提出一新损失函数,可改善用此 DA 技术训练的 DNN 的校准,且有时也改善其准确率。我们的损失受贝叶斯决策理论启发,并引入了用于设计概率建模损失的新训练框架。我们提供了具有校准性能一致改善的当前最优准确率。附录与代码见:https://github.com/jmaronas/calibration_MixupDNN_ARCLoss.pytorch.git

关键词

引用

@article{arxiv.2003.09946,
  title  = {On Calibration of Mixup Training for Deep Neural Networks},
  author = {Juan Maroñas and Daniel Ramos and Roberto Paredes},
  journal= {arXiv preprint arXiv:2003.09946},
  year   = {2021}
}

备注

To appear in S+SSPR2020