中文

抗灾忘记的大语言模型训练新方法——MoE-CT

计算与语言 2024-07-02 v1 人工智能

摘要

大语言模型 (LLM) 的出现主要满足高资源语言需求,导致低资源语言性能存在差距。传统的持续训练 (CT) 方法常常在扩展到多语言情境时削弱模型对原始语言能力。为此,我们引入一种新型 MoE-CT 架构,创新性地将基础模型的学习与多语言扩展过程分离。我们的设计冻结原始 LLM 参数,从而保护其在高资源语言中的性能,同时通过附加的 MoE 模块在多样化语言数据集上进行训练,提升对低资源语言的掌握。我们的做法显著优于传统 CT 方法,实验结果显示在不牺牲模型原始语言性能的前提下,多语言基准显著提升。此外,我们的 MoE-CT 框架展现出对忘记的增强抗性和更优的迁移学习能力。通过保持基础模型的完整性并专注于策略性参数扩展,我们的方法推动了多语言语言建模的发展,为 LLM 中低资源语言的包含性提供了重要的进步方向。

关键词

引用

@article{arxiv.2407.00875,
  title  = {MoE-CT: A Novel Approach For Large Language Models Training With Resistance To Catastrophic Forgetting},
  author = {Tianhao Li and Shangjie Li and Binbin Xie and Deyi Xiong and Baosong Yang},
  journal= {arXiv preprint arXiv:2407.00875},
  year   = {2024}
}

备注

13 pages, 2 figures