中文

POET-X:通过扩张正交变换实现LLM训练的内存高效化

机器学习 2026-03-06 v1 人工智能 计算与语言

摘要

大规模语言模型(LLM)的高效稳定训练是现代机器学习系统中的核心挑战。为此,已提出Reparameterized Orthogonal Equivalence Training(POET),即一种通过正交等价变换优化每个权重矩阵的谱保持框架。尽管POET提供了强大的训练稳定性,但其原始实现因密集矩阵乘法导致高内存消耗和计算开销。为克服这些限制,我们引入POET-X,这是一种规模化且内存高效的变体,通过显著降低计算成本进行正交等价变换。POET-X维持了POET的泛化与稳定性优势,同时在吞吐量和内存效率方面实现了显著提升。在我们的实验中,POET-X使在单张Nvidia H100 GPU上预训练百亿参数LLM成为可能,而与之相同设置下,诸如AdamW等标准优化器会耗尽内存。

关键词

引用

@article{arxiv.2603.05500,
  title  = {POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation},
  author = {Zeju Qiu and Lixin Liu and Adrian Weller and Han Shi and Weiyang Liu},
  journal= {arXiv preprint arXiv:2603.05500},
  year   = {2026}
}

备注

Technical report v1 (14 pages, 7 figures, project page: https://spherelab.ai/poetx/)