Innovator:基于细粒度混合专家模式的科学持续预训练与专家回收技术
机器学习
2025-10-17 v2 人工智能
摘要
拥有科学与通用任务知识的大型语言模型(LLM)是科学通用智能的基础。然而,直接使用科学数据进行持续预训练会导致灾难性遗忘,引起通用能力的严重下降。本文提出Innovator,通过在持续预训练期间将预训练稠密LLM回收为细粒度混合专家模型,其中不同专家负责学习不同学科的科学知识,同时使用共享专家处理通用任务。Innovator引入了四阶段的回收训练范式:(1)基于学科特定数据的科学专家诱导;(2)通过FFN维度分解进行细粒度专家分割;(3)科学感知路由预热;(4)基于混合数据集的通用家庭融合训练。该范式使通用领域知识与不同科学学科能够解耦,避免不同知识领域之间的负面相互影响。Innovator总参数533亿,激活参数13.3亿,基于Qwen2.5-7B构建,包含1个共享通用专家和64个专业科学专家(每次激活8个)。在3000亿token的 tri-level 质量控制数据上训练,Innovator在30个科学任务上实现平均提升25%,胜率达70%,同时保持通用任务中99%的性能。此外,基于Innovator后训练的Innovator-Reason在解决复杂科学问题时表现出色,性能提升超过30%。
引用
@article{arxiv.2507.18671,
title = {Innovator: Scientific Continued Pretraining with Fine-grained MoE Upcycling},
author = {Ning Liao and Xiaoxing Wang and Zehao Lin and Weiyang Guo and Feng Hong and Shixiang Song and Geng Yu and Zihua Zhao and Sitao Xie and Longxuan Wei and Xiangqi Jin and Xiaohan Qin and Jiale Ma and Kai Chen and Jiangchao Yao and Zhouhan Lin and Junchi Yan and Zhiyu Li and Feiyu Xiong and Yanfeng Wang and Linfeng Zhang},
journal= {arXiv preprint arXiv:2507.18671},
year = {2025}
}
备注
Technical Report