未被选中的专家同样有贡献:通过自我对比释放 MoE 模型的潜能
计算机视觉与模式识别
2024-05-24 v1 人工智能
摘要
Mixture-of-Experts(MoE)已成为在保持计算效率的同时扩大模型规模的热门架构。在 MoE 中,输入序列中的每个 token 通过路由机制激活不同的专家子集。然而,未被激活的专家不会为输出做出贡献,可能导致模型容量的 underutilization。本文首先进行探索性研究,表明增加激活专家的数量并不一定会提高效果,甚至可能导致性能下降。随后,我们表明使用不同路由策略的 MoE 模型输出分布显著不同,表明不同的专家并不总是协同工作。基于上述发现,我们提出一种名为自我对比 Mixture-of-Experts(SCMoE)的训练-free 方法,利用自我对比在推理阶段使用未被激活的专家。在 SCMoE 中,通过对强激活和弱激活的输出进行对比来确定下一个 token 的概率。该方法概念简单且计算轻量级,仅比贪心解码增加最小延迟。在多个基准测试(GSM8K、StrategyQA、MBPP 和 HumanEval)上进行实验,表明 SCMoE 在多个领域持续提升了 Mixtral 8x7B 的推理能力。例如,将 GSM8K 的准确率从 61.79 提升到 66.94。此外,结合 SCMoE 和自我一致性(self-consistency),可获得额外提升,将主要@20准确率从 75.59 提升到 78.31。
引用
@article{arxiv.2405.14506,
title = {SIAVC: Semi-Supervised Framework for Industrial Accident Video Classification},
author = {Zuoyong Li and Qinghua Lin and Haoyi Fan and Tiesong Zhao and David Zhang},
journal= {arXiv preprint arXiv:2405.14506},
year = {2024}
}