理解并缓解预训练中的标签噪声对下游任务的影响
机器学习
2024-03-12 v2 人工智能
计算机视觉与模式识别
摘要
在大规模数据集上预训练然后在下游任务上微调已成为深度学习的标准做法。然而,预训练数据常含有可能对模型泛化产生不利影响的标签噪声。本文旨在理解预训练数据集中噪声的本质,并缓解其对下游任务的影响。更具体地说,通过在合成含噪ImageNet-1K和YFCC15M数据集上对有监督预训练模型进行大量实验,我们证明:虽然预训练中的轻微噪声有利于同分布(ID)迁移性能(训练与测试数据共享同一分布),但它总会损害异分布(OOD)性能(训练与测试数据分布不同)。我们通过实验验证其背后的原因是预训练中的噪声以不同方式塑造了特征空间。接着,我们提出一种轻量级黑盒微调方法(NMTune)来对特征空间进行仿射变换,以缓解噪声的有害影响并改善ID和OOD任务上的泛化,同时考虑到人们可能无法完全微调甚至无法访问预训练模型。我们在基于含噪数据预训练的流行视觉与语言模型上进行了实际实验以评估我们的方法。我们的分析与结果表明了这一有趣且新颖的研究方向的重要性,我们称之为噪声模型学习(Noisy Model Learning)。
引用
@article{arxiv.2309.17002,
title = {Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks},
author = {Hao Chen and Jindong Wang and Ankit Shah and Ran Tao and Hongxin Wei and Xing Xie and Masashi Sugiyama and Bhiksha Raj},
journal= {arXiv preprint arXiv:2309.17002},
year = {2024}
}
备注
ICLR 2024 Spotlight