专家联合:将分层路由适配于等价分解的Transformer
机器学习
2025-09-24 v3 人工智能
计算与语言
摘要
混合专家在保持计算效率的同时提升了模型性能,使其非常适合大规模应用。传统的混合专家架构存在协调动态欠佳的问题,其中孤立的专家操作使模型面临过拟合风险。此外,它们尚未有效扩展至注意力块,这限制了效率的进一步提升。为解决这些问题,我们提出专家联合,将 Transformer 模型分解为等价的专家组,并应用分层路由机制将输入子空间分配给专门的专家。我们的方法通过四项关键创新推进了 MoE 设计:(1) 通过将非 MoE 模型划分为功能等价的专家来构建专家组;(2) 开发集成分块数据选择与专家选择策略的分层路由范式;(3) 将 MoE 设计扩展至注意力块;(4) 提出利用批量矩阵乘法进行高效专家计算的硬件优化并行方案。实验表明,我们的 UoE 模型在图像和自然语言领域的多个任务中超越了全注意力、最先进的 MoE 和高效 Transformer。在语言建模任务中,UoE 相比性能最佳的 MoE 方法,仅用其 76% 的 FLOPs 即实现了 2.38 的平均困惑度降低。在 Long Range Arena 基准测试中,其平均得分比所有对比模型至少高出 0.68%,且仅使用最佳 MoE 方法 50% 的 FLOPs。在图像分类中,相比最佳模型,其平均准确率提升了 1.75%,同时保持了相当的 FLOPs。源代码可在 https://github.com/YujiaoYang-work/UoE 获取。
关键词
引用
@article{arxiv.2503.02495,
title = {Union of Experts: Adapting Hierarchical Routing to Equivalently Decomposed Transformer},
author = {Yujiao Yang and Jing Lian and Linhui Li},
journal= {arXiv preprint arXiv:2503.02495},
year = {2025}
}