中文

XPERT:面向不同模型规模的语言模型训练的专家知识迁移框架

计算与语言 2026-05-12 v1

摘要

混合专家(Mixture-of-Experts,MoE)语言模型将知识组织到显式路由的专家模块中,使专家级别的表示可被追踪和分析。通过分析 MoE 大型语言模型(LLM)中的专家激活模式,我们发现一小部分专家在 diverse知识领域中始终被激活。这些通用专家编码了跨域、可泛化的知识,与模型泛化能力密切相关,这自然引出一个问题:如何实际重用此类可识别的专家知识。为了回应这一观察,我们提出 XPERT 框架,从预训练 MoE LLM 中提取、整合并重用专家知识,以支持不同模型规模下的更有效训练。XPERT 通过推理-only 分析识别跨域专家,通过张量分解细化其表示,并将提取的知识适配到下游模型中。在语言理解和对话生成基准测试中,获得重用专家知识模型一致更佳性能和更快收敛速度的实验结果。这些结果表明,MoE LLM 作为结构化和可重用的知识来源,而专家级别的知识重用对提高模型训练具有重要价值。

关键词

引用

@article{arxiv.2605.08842,
  title  = {XPERT: Expert Knowledge Transfer for Effective Training of Language Models},
  author = {Chang Liu and Boyu Shi and Xu Yang and Xin Geng},
  journal= {arXiv preprint arXiv:2605.08842},
  year   = {2026}
}