Yuan 2.0-M32:基于注意力路由的专家混合模型
人工智能
2024-05-30 v2 计算与语言
摘要
Yuan 2.0-M32基于Yuan-2.0 2B的类似基础架构,使用包含32个专家且仅激活2个专家的混合专家架构。提出并采用了新的路由网络——注意力路由器,以实现对专家选择的更高效,相较于采用经典路由网络的模型,准确率得到提升。Yuan 2.0-M32使用从零开始训练2000B个标记,训练计算消耗仅为相同参数规模稠密模型的9.25%。Yuan 2.0-M32在编码、数学及多种专业领域展现出竞争能力,仅使用37亿有效参数(总计400亿参数),每token前向计算仅需7.4 GFlops,两者均仅为Llama3-70B的1/19。Yuan 2.0-M32在MATH和ARC-Challenge基准测试中超越Llama3-70B,准确率分别为55.89%和95.8%。Yuan 2.0-M32的模型及源码已发布于Github。
关键词
引用
@article{arxiv.2405.17976,
title = {Yuan 2.0-M32: Mixture of Experts with Attention Router},
author = {Shaohua Wu and Jiangang Luo and Xi Chen and Lingjun Li and Xudong Zhao and Tong Yu and Chao Wang and Yue Wang and Fei Wang and Weixu Qiao and Houbo He and Zeru Zhang and Zeyu Sun and Junxiong Mao and Chong Shen},
journal= {arXiv preprint arXiv:2405.17976},
year = {2024}
}
备注
14 pages,3 figures, 7 tables