增强数据的有效标签是什么?利用AutoLabel改善校准与鲁棒性
机器学习
2023-02-23 v1
摘要
大量研究设计了数据增强方法,可提升神经网络的准确率和泛化性能。然而,增强数据可能远离干净训练数据,且何为恰当标签变得模糊。尽管如此,大多数现有工作仅为增强数据使用one-hot标签。本文中,我们表明对高度失真数据复用one-hot标签可能引入噪声并降低准确率和校准。为缓解此问题,我们提出一种通用方法AutoLabel,基于干净分布与增强分布之间的变换距离,自动学习增强数据标签的置信度。AutoLabel构建于标签平滑之上,并由留出验证集上的校准性能引导。我们成功将AutoLabel应用于三种不同的数据增强技术:最先进的RandAug、AugMix和对抗训练。在CIFAR-10、CIFAR-100和ImageNet上的实验表明,AutoLabel显著改善了现有数据增强技术的模型校准和准确率,尤其在分布偏移下。
引用
@article{arxiv.2302.11188,
title = {What Are Effective Labels for Augmented Data? Improving Calibration and Robustness with AutoLabel},
author = {Yao Qin and Xuezhi Wang and Balaji Lakshminarayanan and Ed H. Chi and Alex Beutel},
journal= {arXiv preprint arXiv:2302.11188},
year = {2023}
}
备注
Accepted to SaTML-2023