GW-MoE:基于全局工作空间理论解决 MoE 路由不确定性问题
机器学习
2024-06-19 v1 人工智能
摘要
混合专家(MoE)已被证明是扩大模型规模的有效方法。通过动态稀疏选择激活专家,MoE 能有效降低计算成本。尽管取得成功,但我们注意到许多 token 在 MoE 模型中存在路由不确定性,这些 token 对于选择每个专家的得分几乎相等,我们证明这种不确定性可能导致错误选择。灵感来自全局工作空间理论(GWT),我们提出了一种新型微调方法,GW-MoE,用于解决此问题。核心思想是在微调期间将不确定的 token 广播到所有专家。因此,这些 token 可在推理时从任何专家获取必要知识,从而对选择不那么敏感。GW-MoE 不引入额外的推理开销。我们验证了 GW 能缓解不确定问题,并在不同任务(文本分类、问答、摘要、代码生成和数学问题求解)和模型规模(650M 和 8B 参数)中持续提升。
引用
@article{arxiv.2406.12375,
title = {GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory},
author = {Haoze Wu and Zihan Qiu and Zili Wang and Hang Zhao and Jie Fu},
journal= {arXiv preprint arXiv:2406.12375},
year = {2024}
}