中文

优化器设计的对称相容原理:Embedding、LM Head、SwiGLU MLP 与 MoE Router

最优化与控制 2026-05-27 v2 人工智能 机器学习 机器学习

摘要

在深度学习实践中,长期存在一种显著的几何差异。现代神经网络架构自然地展现出丰富的对称性与等变性性质,而 Adam 等流行优化器及其变体本质上是在坐标方向上操作的,使其无法尊重参数空间的等变结构。我们通过引入一种用于优化器设计的对称相容原理来解决这一差异:梯度更新规则应在作用于相应权重块的对称群下是等变的。遵循这一原理,我们首先提供了一个关于一般矩阵层的双正交等变更新的统一视角,如随机谱下降、Muon、Scion 和极梯度方法所采用的。更重要的是,通过从正交群转向置换对称与共享平移对称,我们为对称性不同于一般矩阵层的参数块推导了对称相容的优化器:Embedding 和 LM head 矩阵、SwiGLU MLP 投影以及 MoE router 矩阵。这些构造包括单边谱、行范数、混合行范数/谱、行感知、列感知、中心化行范数和左谱更新。它们产生了一个端到端的逐层优化器栈,其中每个主要的矩阵值参数类都被分配了一个等变性与其对称群相匹配的更新。我们通过在稠密和稀疏 MoE 语言模型(包括 Qwen3-0.6B 风格、Gemma 3 1B 风格、OLMoE-1B-7B 风格以及缩小版的 gpt-oss 架构)上的预训练实验来印证这一原理。在这些实验中,对称相容的更新规则持续改善了最终的验证损失,减少了稀疏 MoE 模型中的负载不平衡,并在若干情况下相比相应的 AdamW 更新提升了训练稳定性。

关键词

引用

@article{arxiv.2605.18106,
  title  = {Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers},
  author = {Tim Tsz-Kit Lau and Weijie Su},
  journal= {arXiv preprint arXiv:2605.18106},
  year   = {2026}
}