OLMoE:开放式混合专家语言模型
计算与语言
2025-03-04 v2 人工智能
机器学习
摘要
我们介绍OLMoE,一个完全开放且具有最新成就的稀疏混合专家(MoE)语言模型。OLMoE-1B-7B拥有70亿(B)参数,但仅使用10亿个参数来处理每个输入标记。我们在5万亿个标记上进行预训练,并进一步调整以创建OLMoE-1B-7B-Instruct。我们的模型在与类似活跃参数的模型中表现出色,甚至超越了Llama2-13B-Chat和DeepSeekMoE-16B等更大模型。我们present了各种关于MoE训练的实验,分析了我们模型中的路由显示出高度专业化,并开源了我们工作的所有方面:模型权重、训练数据、代码和日志。
引用
@article{arxiv.2409.02060,
title = {OLMoE: Open Mixture-of-Experts Language Models},
author = {Niklas Muennighoff and Luca Soldaini and Dirk Groeneveld and Kyle Lo and Jacob Morrison and Sewon Min and Weijia Shi and Pete Walsh and Oyvind Tafjord and Nathan Lambert and Yuling Gu and Shane Arora and Akshita Bhagia and Dustin Schwenk and David Wadden and Alexander Wettig and Binyuan Hui and Tim Dettmers and Douwe Kiela and Ali Farhadi and Noah A. Smith and Pang Wei Koh and Amanpreet Singh and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2409.02060},
year = {2025}
}
备注
63 pages (24 main), 36 figures, 17 tables