中文

改进神经网络微调的正则化与鲁棒性

机器学习 2025-08-15 v2 计算机视觉与模式识别 机器学习

摘要

迁移学习中一种广泛使用的算法是微调,即用少量标注数据在目标任务上对预训练模型进行微调。当预训练模型的容量显著大于目标数据集的规模时,微调容易过拟合并记忆训练标签。因此,一个关键问题是对微调进行正则化并确保其针对噪声的鲁棒性。为解决这个问题,我们首先分析微调的泛化性质。我们给出了一个 PAC-Bayes 泛化界,它依赖于微调过程中每一层所走过的距离以及微调模型的噪声稳定性。我们对这些量进行了经验测量。基于该分析,我们提出了正则化自标注——正则化方法与自标注方法之间的插值,包括(i)层-wise 正则化以约束每一层所走过的距离;(ii)自标签校正与标签重加权,以纠正(模型有信心的)错误标注数据点,并对置信度较低的数据点重新加权。我们在使用多个预训练模型架构的大量图像与文本数据集上验证了我们的方法。我们的方法在七个图像分类任务上平均比基线方法提高 1.76%,在少样本分类任务上提高 0.75%。当目标数据集包含噪声标签时,我们的方法在两种噪声设置下平均优于基线方法 3.56%。

关键词

引用

@article{arxiv.2111.04578,
  title  = {Improved Regularization and Robustness for Fine-tuning in Neural Networks},
  author = {Dongyue Li and Hongyang R. Zhang},
  journal= {arXiv preprint arXiv:2111.04578},
  year   = {2025}
}

备注

22 pages. Appeared in NeurIPS'21