通过截断奇异值分解层实现 LLM 高效预训练
机器学习
2026-05-28 v1 人工智能
摘要
大型语言模型(LLM)的规模化扩展使得预训练越来越昂贵。虽然低秩表示和正交权矩阵在原则上可以减少参数数量和计算开销,但大多数现有方法依赖于静态秩选择,且由于计算成本高,不强制执行权重正交性。本文引入了 TSVD 框架,在训练过程中维持低秩和严格正交性。它利用基于谱能的启发式方法进行自适应秩选择,并通过缓存机制维持正交性。理论分析论证了该方法在预训练动力学中的优势,实验在 various 模型规模下表明其实际效果显著。TSVD 在显著降低计算需求的同时,匹配或超过了全参数基线的性能。该方法为实现高性能 LLM 预训练提供了一条切实可行、实用且可扩展的路径。
引用
@article{arxiv.2605.28573,
title = {Efficient Pre-Training of LLMs through Truncated SVD Layers},
author = {Kaivan Kamali and Kajetan Schweighofer and Hormoz Shahrzad and Olivier Francon and Babak Hodjat and Risto Miikkulainen},
journal= {arXiv preprint arXiv:2605.28573},
year = {2026}
}