针对数据定制的 Mixup 以增强模型校准
机器学习
2025-03-20 v3 人工智能
机器学习
摘要
在迄今提出的所有数据增强技术中,训练样本的线性插值(亦称 Mixup)已被发现对大量应用有效。除提升预测性能外,Mixup 也是改善校准的良好技术。然而, careless 地混合数据会导致流形失配,即合成数据位于原始类流形之外,从而恶化校准。本工作中,我们表明使用 mixup 赋予错误标签的可能性随待混合数据间距离的增大而增大。为此,我们提出根据待混合样本间的相似度动态改变插值系数的底层分布,并定义了一个灵活的框架以在实现该点的同时不损失多样性。我们提供了分类与回归任务上的大量实验,表明所提方法在大幅提升效率的同时,改善了模型的预测性能与校准。
引用
@article{arxiv.2311.01434,
title = {Tailoring Mixup to Data for Calibration},
author = {Quentin Bouniot and Pavlo Mozharovskyi and Florence d'Alché-Buc},
journal= {arXiv preprint arXiv:2311.01434},
year = {2025}
}
备注
Published at ICLR 2025. The code available at https://github.com/qbouniot/sim_kernel_mixup