特征即命运:高维回归中的迁移学习理论
机器学习
2025-07-09 v2 机器学习
摘要
随着大规模预训练神经网络的出现,针对数据受限的下游任务对此类“基础”模型的适应方法日益成为必要。精调、偏好优化和迁移学习等方法在目标任务与源任务高度相似时已成功应用,但对“任务相似性”的精确理论理解仍缺乏。虽然传统观念认为,源分布与目标分布之间的简单相似性度量(如 -散度或积分概率度量)可直接预测迁移成功性,但我们证明了惊人的事实:一般情况下,这并非如此。我们采用特征中心主义的视角进行迁移学习,建立了一系列理论结果,表明当目标任务良好地由预训练模型的特征空间表示时,迁移学习优于从头训练。我们将深度线性网络作为迁移学习的最小模型,在其中可解析地表征迁移性相图作为目标数据集大小与特征空间重叠度的函数。对于该模型,我们严格证明当源任务与目标任务之间的特征空间重叠足够强时,无论是线性迁移还是精调在数据有限的极限下均能提升性能。这些结果建立在对深度线性网络中特征学习动力学的新兴理解基础上,我们通过数值实验表明,针对线性情况所导出的严谨结果同样适用于非线性网络。
引用
@article{arxiv.2410.08194,
title = {Features are fate: a theory of transfer learning in high-dimensional regression},
author = {Javan Tahir and Surya Ganguli and Grant M. Rotskoff},
journal= {arXiv preprint arXiv:2410.08194},
year = {2025}
}
备注
29 pages, 7 figures