MoDE:一种专家间相互蒸馏的混合专家模型
机器学习
2024-02-05 v1 人工智能
摘要
混合专家(MoE)模型因其提升模型性能的能力而日益流行。在MoE结构中,门控层在区分输入特征并将其路由到不同专家方面起着重要作用。这使得每个专家能够专门处理其对应的子任务。然而,门控的路由机制也导致了窄视野问题:单个MoE专家无法使用更多样本来学习分配的子任务,这反过来限制了MoE进一步提高其泛化能力。为了有效解决这个问题,我们提出了一种称为混合蒸馏专家(MoDE)的方法,该方法在专家之间应用适度的相互蒸馏,使每个专家能够获取其他专家学到的更多特征,并对其原始分配的子任务获得更准确的感知。我们进行了大量实验,包括表格、NLP和CV数据集,结果表明MoDE的有效性、通用性和鲁棒性。此外,我们通过创新性地构建“专家探测”进行了并行研究,实验证明了MoDE为何有效:适度的知识蒸馏可以提高每个专家在其分配任务上的测试性能,从而导致MoE整体性能的提升。
引用
@article{arxiv.2402.00893,
title = {MoDE: A Mixture-of-Experts Model with Mutual Distillation among the Experts},
author = {Zhitian Xie and Yinger Zhang and Chenyi Zhuang and Qitao Shi and Zhining Liu and Jinjie Gu and Guannan Zhang},
journal= {arXiv preprint arXiv:2402.00893},
year = {2024}
}
备注
Accepted by AAAI-24