中文

HyperRouter:迈向稀疏混合专家的高效训练与推理

机器学习 2023-12-13 v1 人工智能

摘要

通过将输入 token 仅路由至少数划分的专家,稀疏混合专家使得大型语言模型的高效训练成为可能。近期研究发现,固定路由器可以通过缓解崩溃问题(即所有专家最终学到相似的表示)来实现有竞争力的性能。然而,该策略有两个关键局限性: 随机路由器导出的策略可能是次优的; 它在训练和评估期间需要大量资源,导致效率提升有限。本研究提出 \HyperRout,通过固定的超网络和可训练的嵌入动态生成路由器参数,以在训练路由器与冻结路由器之间取得平衡,从而学习到改进的路由策略。在广泛任务上的大量实验表明,与现有路由方法相比,\HyperRouter 具有优越的性能和效率提升。我们的实现公开于 {\url{{https://github.com/giangdip2410/HyperRouter}}}。

关键词

引用

@article{arxiv.2312.07035,
  title  = {HyperRouter: Towards Efficient Training and Inference of Sparse Mixture of Experts},
  author = {Giang Do and Khiem Le and Quang Pham and TrungTin Nguyen and Thanh-Nam Doan and Bint T. Nguyen and Chenghao Liu and Savitha Ramasamy and Xiaoli Li and Steven Hoi},
  journal= {arXiv preprint arXiv:2312.07035},
  year   = {2023}
}