关于混合专家架构的线性模式连通性
机器学习
2025-10-28 v2
摘要
线性模式连通性(LMC)是神经网络损失景观中一个显著的现象,其中独立训练的模型被观察到在参数空间中通过线性路径连接(在排列对称性下),沿着这些路径损失始终保持较低。这一观察挑战了非凸优化的经典观点,并对模型集成、泛化以及我们对神经损失几何的理解具有意义。受最近关于标准神经网络中LMC研究的启发,我们系统地研究了混合专家(MoE)架构中的这一现象——这类模型以其可扩展性和计算效率而闻名,通过可学习的门控机制结合了传统神经网络(称为专家)。我们首先对密集和稀疏门控机制进行了全面分析,证明了MoE架构固有的对称性完全由作用于专家组件和门控函数的排列来表征。基于这些基础发现,我们提出了一种匹配算法,能够对齐独立训练的MoE,从而促进LMC的发现。最后,我们使用我们提出的算法在各种MoE配置(包括密集、稀疏和共享专家变体)以及广泛的模型设置和不同规模和模态的数据集上实证验证了LMC的存在。我们的结果证实了MoE架构中LMC的存在,并为深度学习模型的功能景观和优化动力学提供了基本见解。
引用
@article{arxiv.2509.11348,
title = {On Linear Mode Connectivity of Mixture-of-Experts Architectures},
author = {Viet-Hoang Tran and Van Hoan Trinh and Khanh Vinh Bui and Tan M. Nguyen},
journal= {arXiv preprint arXiv:2509.11348},
year = {2025}
}