中文

LoLCATs:大语言模型低秩线性化

机器学习 2025-03-07 v3 人工智能 计算与语言 机器学习

摘要

最近的研究表明,可以线性化大型语言模型(LLM)——用次二次类注意力替代基于 Transformer 的 LLM 的二次注意力(如线性注意力),从而避免昂贵的预训练成本。然而,线性化 LLM 常常显著降低模型质量,仍需要数十亿标记的训练,且仅限于较小的 13B 至 7B LLM。我们因此提出 Low-rank Linear Conversion via Attention Transfer(LoLCATs),一种简单两步方法,通过注意力转移提高 LLM 线性化质量,所需内存和计算量降低数量级。我们基于两个发现结果构建这些步骤:首先,通过以输出 MSE 损失训练线性注意力以匹配其 Softmax 对应项(注意力转移),可以将 LLM 的 Softmax 注意力替换为近似的线性注意力。随后,这使我们能够通过低秩适应(LoRA)来纠正近似误差并恢复 LLM 质量。LoLCATs 显著提高线性化质量、训练效率和可扩展性。我们显著缩小线性化质量差距,生成来自 Llama 3 8B 和 Mistral 7B v0.1 的最先进次二次 LLM,在 5-shot MMLU 上提升 20+ 分。此外,LoLCATs 只需约 0.2% 过去方法的模型参数和 0.4% 的训练标记。最后,我们将 LoLCATs 应用于创建首个线性化 70B 和 405B LLM(规模是 prior work 的 50 倍)。在相同计算预算下与 prior 方法进行比较时,LoLCATs 在线性化质量方面显著优于,使 Llama 3.1 70B 和 405B LLM 与线性化版本之间的 5-shot MMLU 差距分别缩小 77.8% 和 78.1%。

关键词

引用

@article{arxiv.2410.10254,
  title  = {LoLCATs: On Low-Rank Linearizing of Large Language Models},
  author = {Michael Zhang and Simran Arora and Rahul Chalamala and Alan Wu and Benjamin Spector and Aaryan Singhal and Krithik Ramesh and Christopher Ré},
  journal= {arXiv preprint arXiv:2410.10254},
  year   = {2025}
}

备注

58 pages, 25 figures, 26 tables, ICLR 2025