DeCAF:用于基础模型低秩适配的去中心化共识与分解
机器学习
2025-05-28 v1
摘要
低秩适配(LoRA)已成为训练视觉语言模型(VLMs)和大语言模型(LLMs)最有效且计算上易于处理的微调方法之一。LoRA 通过冻结预训练模型权重并注入可训练的低秩矩阵来实现这一点,允许即使在边缘设备上也能对这些基础模型进行高效学习。然而,去中心化环境下的 LoRA 仍未得到充分探索,特别是由于缺乏平滑性保证和模型共识干扰(定义见下文),其理论基础仍显不足。这项工作通过确保梯度平滑性,将去中心化 LoRA(DLoRA)的收敛速率提升至与去中心化 SGD 相匹配的水平。我们还引入了 DeCAF,这是一种将 DLoRA 与基于截断奇异值分解(TSVD)的矩阵分解相结合的新颖算法,以解决共识干扰问题。理论分析表明,TSVD 的近似误差是有界的,并且随着秩的增加,DLoRA 与 DeCAF 之间的共识差异会消失,从而使 DeCAF 获得相匹配的收敛速率。在视觉/语言任务上的大量实验表明,我们的算法优于局部训练,并且在 IID 和 non-IID 数据分布下均能与联邦学习相媲美。
引用
@article{arxiv.2505.21382,
title = {DeCAF: Decentralized Consensus-And-Factorization for Low-Rank Adaptation of Foundation Models},
author = {Nastaran Saadati and Zhanhong Jiang and Joshua R. Waite and Shreyan Ganguly and Aditya Balu and Chinmay Hegde and Soumik Sarkar},
journal= {arXiv preprint arXiv:2505.21382},
year = {2025}
}