中文

低秩训练的快速前向

机器学习 2024-09-09 v1 计算与语言

摘要

低秩适应(LoRA等)等参数高效微调方法旨在降低预训练语言模型(LM)微调的计算成本。基于这些低秩设置,我们提出一种更高效的优化策略:快速前向(Fast Forward),这是一种简单且有效的加速大段训练的方法。在一次快速前向阶段,我们重复最近的优化步骤,直到该步骤在小型验证集上的损失停止改善。通过在常规优化步骤与快速前向阶段之间交替,快速前向可将标准SGD with Adam的FLOPs减少最高可达87%,训练时间减少最高可达81%。我们通过在不同任务上对各种模型进行微调来验证快速前向,并证明其可在不损害模型性能的情况下加速训练。此外,我们分析了何时以及如何应用快速前向。

关键词

引用

@article{arxiv.2409.04206,
  title  = {Fast Forwarding Low-Rank Training},
  author = {Adir Rahamim and Naomi Saphra and Sara Kangaslahti and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2409.04206},
  year   = {2024}
}