中文

解构 LLM 预训练中的流形约束

机器学习 2026-05-07 v1 人工智能 最优化与控制

摘要

大型语言模型(LLM)预训练的实证成功严重依赖于诸如显式归一化层和权力衰减等经验性稳定技术。虽然最近的受约束优化方法通过显式限制权重可能提高数值稳定性和性能,但其机制与添加约束的动机仍然尚不明了。本文系统性地解构了 LLM 预训练中显式流形约束的作用。通过引入 Msign-Aligned Constrained Riemannian Optimizer(MACRO)——一种可证收敛的单回路优化框架——我们的研究将权重正则化的经验技巧从如均衡根号归一化和解耦权力衰减等相互作用的机制中分离。理论分析和全面实证评估揭示,流形约束独立地约束前向激活尺度并强制稳定的旋转平衡,从而吸收了这些经验性机制的作用。在大规模 LLM 架构上的评估表明,MACRO 在实现高度具竞争力的性能的同时,严格保留了精确黎曼优化的理论保证。

关键词

引用

@article{arxiv.2605.04418,
  title  = {Demystifying Manifold Constraints in LLM Pre-training},
  author = {Kang An and Jiaxiang Li and Donald Goldfarb and Shiqian Ma},
  journal= {arXiv preprint arXiv:2605.04418},
  year   = {2026}
}