混合专家模型中的几何正则化:权重与激活之间的断裂
机器学习
2026-01-05 v1 人工智能
摘要
混合专家(MoE)模型通过稀疏激活实现效率,但专家专一化中几何正则化的作用仍不明确。我们应用正交损失以强制专家多样性,发现其在多个方面均未能实现目标:它未能减少权重空间重叠(MSO实际上增加了最高达114%),激活空间重叠仍保持在约0.6的高水平,无论是否进行正则化;对性能的影响也不一致——在WikiText-103上仅提升了-0.9%,在TinyStories上略有下降+0.9%,在PTB上的结果高度波动(标准差>1.0)。我们在7种正则化强度下的分析揭示,权重正交性与激活正交性之间不存在显著相关性(r = -0.293, p = 0.523)。这些发现表明,权空间正则化既未实现其几何目标,亦未可靠地提升性能,因而不适用于MoE的多样性问题。
引用
@article{arxiv.2601.00457,
title = {Geometric Regularization in Mixture-of-Experts: The Disconnect Between Weights and Activations},
author = {Hyunjun Kim},
journal= {arXiv preprint arXiv:2601.00457},
year = {2026}
}