PreLoRA:结合全量训练与低秩适配器的视觉 Transformer 混合预训练
机器学习
2026-03-16 v2 性能
摘要
训练参数量从数百万到数十亿不等的大型模型高度消耗资源,需要大量的时间、算力和内存。据观察,大部分学习(权重的较大变化)发生在训练循环的早期阶段。随着训练的进行,这些变化趋于稳定,这表明由此产生的更新可能适合用低本征秩矩阵来近似。因此,我们提出了一种方法来识别这种部分收敛的状态,并在 ViT-Large 模型上动态地从全参数训练切换到低秩适配(LoRA)。我们引入了一种灵活的方法,利用用户定义的超参数来确定切换点,并根据每个模块层的收敛水平分配特定的秩。实验结果表明,该方法在保持模型准确率的同时,将可训练参数的数量减少到原始规模的 10%,吞吐量提高了 3 倍,每轮平均训练时间减少了 1.5 倍,同时 GPU 内存消耗降低了 20%。
关键词
引用
@article{arxiv.2509.21619,
title = {PreLoRA: Hybrid Pre-training of Vision Transformers with Full Training and Low-Rank Adapters},
author = {Krishu K Thapa and Reet Barik and Krishna Teja Chitty-Venkata and Murali Emani and Venkatram Vishwanath},
journal= {arXiv preprint arXiv:2509.21619},
year = {2026}
}
备注
13 pages, 8 figures, 2 algorithms, workshop paper