基于正交等价变换的重参数化 LLM 训练
机器学习
2025-12-12 v4 人工智能
计算与语言
摘要
尽管大型语言模型 (LLM) 正在推动人工智能的快速发展,但有效且可靠地训练这些大型模型仍然是该领域最重大的挑战之一。为了应对这一挑战,我们提出了 POET,一种新颖的重参数化训练算法,利用正交等价变换来优化神经元。具体而言,POET 使用两个可学习的正交矩阵和一个固定的随机权重矩阵对每个神经元进行重参数化。由于可证明地保持了权重矩阵的谱性质,POET 能够稳定地优化目标函数并提升泛化能力。我们进一步开发了高效的近似方法,使 POET 在训练大规模神经网络时具备灵活性和可扩展性。大量实验验证了 POET 在训练 LLM 时的有效性和可扩展性。
引用
@article{arxiv.2506.08001,
title = {Reparameterized LLM Training via Orthogonal Equivalence Transformation},
author = {Zeju Qiu and Simon Buchholz and Tim Z. Xiao and Maximilian Dax and Bernhard Schölkopf and Weiyang Liu},
journal= {arXiv preprint arXiv:2506.08001},
year = {2025}
}
备注
NeurIPS 2025 (40 pages, 26 figures, project page: https://spherelab.ai/poet/, v4: added experiments of finetuning and larger-scale pretraining)