中文

MoIN:混合内向专家以提升大语言模型

机器学习 2024-10-15 v1 人工智能 计算与语言

摘要

本文旨在改进(提升)现有的大型语言模型,而无需对整个模型进行高昂的持续预训练要求。其核心思想是将预训练数据划分为语义相关的子组,并在每个子集上训练一个专家。专家的形式是作为冻结基础模型上添加的轻量级适配器。在推理阶段,输入查询首先被路由到最相关的专家,然后将其加载到基础模型上进行前向传播。与典型的混合专家(MoE)模型不同,本方法中的专家不与其他专家共同处理单个查询。因此,我们将其称为"内向"专家。冻结基础模型并将专家保持为轻量级适配器,允许在训练和推理期间实现极致并行。所有专家的训练可以在没有彼此之间通信通道的情况下并行完成。类似地,推理也可以通过在不同的GPU上分布专家,并将每个请求路由到包含其相关专家的GPU来实现高度并行化。我们实现了一个本构版本的方法,展示了该方法的有效性。

关键词

引用

@article{arxiv.2410.09687,
  title  = {MoIN: Mixture of Introvert Experts to Upcycle an LLM},
  author = {Ajinkya Tejankar and KL Navaneet and Ujjawal Panchal and Kossar Pourahmadi and Hamed Pirsiavash},
  journal= {arXiv preprint arXiv:2410.09687},
  year   = {2024}
}