谱紧凑训练:通过永久截断 SVD 和 Stiefel QR 投影预训练大型语言模型
机器学习
2026-04-07 v2 人工智能
摘要
内存壁垒仍是大型语言模型在消费级硬件上训练的主要瓶颈。我们提出谱紧凑训练 (SCT),一种方法将稠密权重矩阵替换为永久截断 SVD 因子 W = U diag(s) V^T,在训练和推理期间从不实际构筑完整稠密矩阵。梯度通过标准反向传播传递到紧凑谱因子中,U、V 在每个优化器步骤后通过 QR 分解投回 Stiefel 流形上。SCT 在 r=32 时实现了每个 MLP 层最高 199 倍的内存降低,使在配备 7.2 GB 峰值内存的 Steam Deck 手持设备上完成 70 亿参数架构的完整训练步骤成为可能(相较于稠密 FP32 训练中 1245 GB 的内存需求)。在 SmolLM2-1.7B 上进行的秩扫描实验显示,r=32-256(2000 步,NVIDIA A100)的所有测试秩都收敛到相同的损失底部(≈4.2-4.5),表明学习率计划——而非 MLP 秩——是主要瓶颈。r=128 成为 11.7 倍 MLP 压缩比、最低困惑度的效率 sweet spot。GPU 内存在 r=32 时降低 46%,训练吞吐量翻倍。
关键词
引用
@article{arxiv.2604.00733,
title = {Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction},
author = {Björn Roman Kohlberger},
journal= {arXiv preprint arXiv:2604.00733},
year = {2026}
}
备注
8 pages, 3 figures, 4 tables. Patent pending: Irish Application PTIE20260000000219. Code at https://github.com/EctoSpace/SCT