UMoE:利用共享专家统一注意力机制与前馈网络
机器学习
2025-10-24 v2 人工智能
摘要
稀疏混合专家(MoE)架构已成为扩展Transformer模型的一种有前景的方法。虽然早期工作主要将MoE引入前馈网络(FFN)层,但近期研究已探索将MoE范式扩展到注意力层以提升模型性能。然而,现有的基于注意力的MoE层需要专门的实现,并且与基于FFN的同类方法相比性能欠佳。在本文中,我们旨在通过引入一种新颖的注意力机制重构来统一注意力层和FFN层中的MoE设计,该重构揭示了注意力模块内部潜在的类FFN结构。我们提出的架构UMoE通过基于注意力的MoE层实现了卓越的性能,同时实现了FFN和注意力组件之间的高效参数共享。
引用
@article{arxiv.2505.07260,
title = {UMoE: Unifying Attention and FFN with Shared Experts},
author = {Yuanhang Yang and Chaozheng Wang and Jing Li},
journal= {arXiv preprint arXiv:2505.07260},
year = {2025}
}
备注
NeurIPS 2025 Spotlight