通过弱 Vanilla Transformer 提升 Mixture-of-Experts Transformer 的下游性能
计算与语言
2025-11-17 v2
摘要
最近,混合专家 Transformer 因其在模型容量和计算效率方面的优势而受到越来越多的关注。然而,研究表明,MoE Transformer 在许多下游任务中的表现不如 vanilla Transformer,这大大削弱了 MoE 模型的实用价值。为了解释这个问题,我们提出模型的预训练性能和迁移能力是其下游任务性能的共同决定因素。与 vanilla 模型相比,MoE 模型的迁移能力较差,导致其在下游任务中表现不佳。为了解决这个问题,我们引入了迁移能力蒸馏的概念,假设尽管 vanilla 模型的性能较弱,但它们是迁移能力的有效教师。在 vanilla 模型指导下的 MoE 模型可以同时具备强大的预训练性能和迁移能力,最终提升其在下游任务中的表现。我们设计了一种具体的蒸馏方法并在 BERT 架构上进行了实验。实验结果表明,MoE 模型的下游性能有显著提升,且许多进一步的证据也强有力地支持了迁移能力蒸馏的概念。最后,我们尝试解释迁移能力蒸馏,并从模型特征的角度提供了一些见解。
引用
@article{arxiv.2403.01994,
title = {Improving the Downstream Performance of Mixture-of-Experts Transformers via Weak Vanilla Transformers},
author = {Xin Lu and Yanyan Zhao and Bing Qin and Ting Liu},
journal= {arXiv preprint arXiv:2403.01994},
year = {2025}
}