中文

大语言模型的知识融合

计算与语言 2024-01-23 v2

摘要

虽然从头训练大语言模型(LLM)可以生成具有不同功能和优势的模型,但这需要巨大的成本,并可能导致能力冗余。另一种经济高效且引人注目的方法是将现有的预训练 LLM 合并为一个更强大的模型。然而,由于这些 LLM 的架构各不相同,直接混合它们的权重是不切实际的。在本文中,我们引入了 LLM 知识融合的概念,旨在结合现有 LLM 的能力并将其转移至单个 LLM 中。通过利用源 LLM 的生成分布,我们将它们的集体知识和独特优势外化,从而有可能将目标模型的能力提升至超越任何单一源 LLM 的水平。我们使用三种具有不同架构的流行 LLM——Llama-2、MPT 和 OpenLLaMA——在各种基准测试和任务上验证了我们的方法。我们的研究结果证实,LLM 的融合可以提升目标模型在推理、常识和代码生成等一系列能力上的表现。我们的代码、模型权重和数据已公开于 \url{https://github.com/fanqiwan/FuseLLM}。

关键词

引用

@article{arxiv.2401.10491,
  title  = {Knowledge Fusion of Large Language Models},
  author = {Fanqi Wan and Xinting Huang and Deng Cai and Xiaojun Quan and Wei Bi and Shuming Shi},
  journal= {arXiv preprint arXiv:2401.10491},
  year   = {2024}
}

备注

Accepted to ICLR 2024