预训练何时损害LoRA微调:通过单指数模型的数学分析
机器学习
2026-05-28 v2 无序系统与神经网络
统计理论
统计理论
摘要
在源任务上进行预训练通常被期望有助于针对类似的下游问题进行微调。在本工作中,我们数学地表明,这种直觉并不总是成立:过度预训练会计算上延缓微调优化。在我们研究了在单指数模型上进行LoRA微调的单次SGD训练后,借助微调动力学的摘要统计描述,我们精确刻画了收敛速度如何取决于初始微调对齐方式以及目标任务的非线性程度。关键要点是,即使预训练和下游任务良好对齐,强预训练也会诱导延长的搜索阶段并阻碍收敛。我们的理论因此提供了预训练强度和任务难度共同塑造LoRA微调动力学和局限性的统一图景。就实际操作而言,我们经验上表明,我们的理论发现超出 toy model,仍然适用于在真实数据上训练的视觉转换器模型。
引用
@article{arxiv.2602.02855,
title = {When pre-training hurts LoRA fine-tuning: a dynamical analysis via single-index models},
author = {Gibbs Nwemadji and Bruno Loureiro and Jean Barbier},
journal= {arXiv preprint arXiv:2602.02855},
year = {2026}
}
备注
38 pages, 14 figures