利用并行低秩适配器从头训练神经网络
机器学习
2024-07-30 v2 人工智能
计算机视觉与模式识别
摘要
深度学习模型的可扩展性从根本上受到计算资源、内存和通信的限制。虽然低秩适配 (LoRA) 等方法降低了模型微调的成本,但其在模型预训练中的应用仍未得到充分探索。本文探讨了将 LoRA 扩展到模型预训练,识别了标准 LoRA 在此背景下的固有约束和局限性。我们引入了 LoRA-the-Explorer (LTE),这是一种新颖的双层优化算法,旨在实现跨计算节点的多个低秩头的并行训练,从而减少对频繁同步的需求。我们的方法包括在各种视觉数据集上使用视觉变换器 (vision transformers) 进行的广泛实验,证明 LTE 与标准预训练具有竞争力。
引用
@article{arxiv.2402.16828,
title = {Training Neural Networks from Scratch with Parallel Low-Rank Adapters},
author = {Minyoung Huh and Brian Cheung and Jeremy Bernstein and Phillip Isola and Pulkit Agrawal},
journal= {arXiv preprint arXiv:2402.16828},
year = {2024}
}