中文

基于神经崩溃理解与改进深度模型迁移学习

机器学习 2024-07-22 v4 人工智能 计算机视觉与模式识别 图像与视频处理 机器学习

摘要

随着大规模预训练模型复杂度的不断增长以及下游训练标注数据的匮乏,迁移学习已成为包括自然语言处理、计算机视觉与多模态学习等诸多领域的主要方法。尽管近期取得进展,视觉中大规模预训练模型的微调过程仍主要依赖试错。本工作研究神经崩溃(NC)与分类问题迁移学习之间的关系。NC 是近期在训练神经网络的最终层特征与线性分类器中发现的引人注目且普遍的现象。具体地,在训练终期,NC 意味着每类内特征的变异性衰减为零,而类间特征均值达到最大且等距。本工作中,我们考察迁移学习中预训练模型在下游与源数据上的 NC 属性,发现特征崩溃与下游性能间存在强相关性。特别地,我们发现了在下游训练数据上线性探测预训练模型时浮现的系统性模式:预训练模型在下游训练数据上特征崩溃越多,迁移准确率越高。此外,我们也研究了源数据上 NC 与迁移准确率的关系。这些发现使我们得以开发一种原则性的、参数高效的微调方法,其采用跳跃连接以诱导下游数据上的末层特征崩溃。我们提出的微调方法在将微调参数减少至少 90% 并缓解下游数据稀缺时的过拟合的同时,取得了良好性能。

关键词

引用

@article{arxiv.2212.12206,
  title  = {Understanding and Improving Transfer Learning of Deep Models via Neural Collapse},
  author = {Xiao Li and Sheng Liu and Jinxin Zhou and Xinyu Lu and Carlos Fernandez-Granda and Zhihui Zhu and Qing Qu},
  journal= {arXiv preprint arXiv:2212.12206},
  year   = {2024}
}

备注

First two authors contributed equally. Accepted at TMLR