中文

低秩适配的表达能力

机器学习 2024-03-19 v3 人工智能 计算与语言 机器学习

摘要

低秩适配(LoRA)是一种利用权重矩阵低秩适配的参数高效微调方法,已成为微调预训练模型(如大语言模型与扩散模型)的流行技术。尽管其在实践中取得巨大成功,LoRA 的理论基础在很大程度上仍未被探索。本文迈出第一步,通过理论分析 LoRA 的表达能力来弥补这一差距。我们证明,对全连接神经网络,若 LoRA 秩 (网络宽度)×目标模型深度原模型深度\geq(\text{网络宽度}) \times \frac{\text{目标模型深度}}{\text{原模型深度}},LoRA 可将任意模型 ff 适配以精确表示任意更小的目标模型 f\overline{f}。我们也量化了当 LoRA 秩低于该阈值时的近似误差。对 Transformer 网络,我们证明任意模型均可被适配至同规模目标模型,且仅需秩为 (嵌入维度2)(\frac{\text{嵌入维度}}{2}) 的 LoRA 适配器。

关键词

引用

@article{arxiv.2310.17513,
  title  = {The Expressive Power of Low-Rank Adaptation},
  author = {Yuchen Zeng and Kangwook Lee},
  journal= {arXiv preprint arXiv:2310.17513},
  year   = {2024}
}

备注

40 pages, 5 figures