中文

基础模型学习中噪声监督的影响

机器学习 2025-05-06 v3 人工智能 计算与语言 计算机视觉与模式识别

摘要

基础模型通常在大规模数据集上进行预训练,然后通过微调适应下游任务。然而,大规模预训练数据集往往难以获取或处理成本过高,且可能包含标签噪声,这会 adversely 影响模型的泛化能力并带来意外风险。本文是首项全面理解和分析预训练数据集中噪声性质,并有效缓解其对下游任务影响的工作。具体而言,通过在合成噪声 ImageNet-1K、YFCC15M 和 CC12M 数据集上进行广泛的全监督和图像 - 文本对比预训练实验,我们证明:虽然预训练中的轻微噪声有利于域内(ID)性能(即训练和测试数据分布相似的情况),但它总是会恶化域外(OOD)性能(即训练和测试分布显著不同的情况)。这些观察结果与预训练数据集的规模、预训练噪声类型、模型架构、预训练目标、下游微调方法以及下游应用无关。我们通过实证确定,其背后的原因是预训练噪声以不同方式塑造了特征空间。随后,我们提出了一种微调方法(NMTune),通过对特征空间进行仿射变换来缓解噪声的恶性影响并提高泛化能力,该方法适用于参数高效微调和黑盒微调两种方式。此外,我们在流行的视觉和语言模型(包括 API)上进行了广泛实验,这些模型在真实噪声数据上进行了监督或自监督预训练以供评估。我们的分析和结果证明了这一新颖且基础的研究方向(我们称之为“噪声模型学习”)的重要性。

关键词

引用

@article{arxiv.2403.06869,
  title  = {Impact of Noisy Supervision in Foundation Model Learning},
  author = {Hao Chen and Zihan Wang and Ran Tao and Hongxin Wei and Xing Xie and Masashi Sugiyama and Bhiksha Raj and Jindong Wang},
  journal= {arXiv preprint arXiv:2403.06869},
  year   = {2025}
}

备注

18 pages, 10 figures, 6 tables, preprint. arXiv admin note: substantial text overlap with arXiv:2309.17002