MH-MoE:多头混合专家模型
计算与语言
2024-12-02 v3
摘要
多头混合专家 (Multi-Head Mixture-of-Experts, MH-MoE) 通过在不同专家中利用多头机制,对信息进行集体注意,从而展现出优异性能。本文提出了 MH-MoE 的一种新型实现,保持其计算复杂度 (FLOPs) 与参数数量与稀疏混合专家模型相当。实验结果表明,新实现在语言模型上优于 vanilla MoE 与细粒度 MoE 模型。此外,我们的实验表明,MH-MoE 可与 1 位大型语言模型 (Large Language Model, LLM) 如 BitNet 兼容。
引用
@article{arxiv.2411.16205,
title = {MH-MoE: Multi-Head Mixture-of-Experts},
author = {Shaohan Huang and Xun Wu and Shuming Ma and Furu Wei},
journal= {arXiv preprint arXiv:2411.16205},
year = {2024}
}
备注
7 pages, 0 figures