中文

增强数据的有效标签是什么?利用AutoLabel改善校准与鲁棒性

机器学习 2023-02-23 v1

摘要

大量研究设计了数据增强方法,可提升神经网络的准确率和泛化性能。然而,增强数据可能远离干净训练数据,且何为恰当标签变得模糊。尽管如此,大多数现有工作仅为增强数据使用one-hot标签。本文中,我们表明对高度失真数据复用one-hot标签可能引入噪声并降低准确率和校准。为缓解此问题,我们提出一种通用方法AutoLabel,基于干净分布与增强分布之间的变换距离,自动学习增强数据标签的置信度。AutoLabel构建于标签平滑之上,并由留出验证集上的校准性能引导。我们成功将AutoLabel应用于三种不同的数据增强技术:最先进的RandAug、AugMix和对抗训练。在CIFAR-10、CIFAR-100和ImageNet上的实验表明,AutoLabel显著改善了现有数据增强技术的模型校准和准确率,尤其在分布偏移下。

关键词

引用

@article{arxiv.2302.11188,
  title  = {What Are Effective Labels for Augmented Data? Improving Calibration and Robustness with AutoLabel},
  author = {Yao Qin and Xuezhi Wang and Balaji Lakshminarayanan and Ed H. Chi and Alex Beutel},
  journal= {arXiv preprint arXiv:2302.11188},
  year   = {2023}
}

备注

Accepted to SaTML-2023