dots.llm1 技术报告
计算与语言
2025-06-09 v1 人工智能
摘要
混合专家(MoE)模型已成为通过为每个输入token激活仅部分参数来高效扩展语言模型的有前景的范例。在本报告中,我们介绍dots.llm1,这是一个大规模MoE模型,在总参数1420亿中激活140亿参数,性能与最先进模型相当,同时降低了训练和推理成本。凭借我们精心构建且高效的数据处理管道,dots.llm1在预训练11.2万亿高质量token后,经过后训练完全释放其能力,性能可与Qwen2.5-72B相当。值得注意的是,在预训练期间未使用任何合成数据。为促进进一步的研究,我们开源了在每1万亿个token处的中间训练检查点,为理解大型语言模型的学习动力学提供了宝贵见解。
引用
@article{arxiv.2506.05767,
title = {dots.llm1 Technical Report},
author = {Bi Huo and Bin Tu and Cheng Qin and Da Zheng and Debing Zhang and Dongjie Zhang and En Li and Fu Guo and Jian Yao and Jie Lou and Junfeng Tian and Li Hu and Ran Zhu and Shengdong Chen and Shuo Liu and Su Guang and Te Wo and Weijun Zhang and Xiaoming Shi and Xinxin Peng and Xing Wu and Yawen Liu and Yuqiu Ji and Ze Wen and Zhenhai Liu and Zichao Li and Zilong Liao},
journal= {arXiv preprint arXiv:2506.05767},
year = {2025}
}