中文

FuseChat:聊天模型的知识融合

计算与语言 2024-08-16 v1

摘要

虽然从头训练大语言模型(LLMs)确实可以产生具有独特能力和优势的模型,但其代价高昂,并可能导致能力冗余。知识融合旨在通过轻量持续训练将具有不同架构和能力的现有 LLMs 整合为一个更强大的 LLM,从而降低昂贵的 LLM 开发需求。在本工作中,我们通过两个主要阶段提出聊天 LLM 知识融合的新框架,得到 FuseChat。首先,我们对结构和规模各异的源聊天 LLMs 进行成对知识融合,通过轻量微调创建多个结构和规模相同的目标 LLMs。在此过程中,提出了一种基于统计的 token 对齐方法,作为融合不同结构 LLMs 的基石。其次,我们在参数空间内合并这些目标 LLMs,其中提出了一种基于微调前后参数更新幅度来确定合并系数的新方法。我们使用六种具有不同架构和规模的知名聊天 LLMs 实现并验证了 FuseChat,包括 OpenChat-3.5-7B、Starling-LM-7B-alpha、NH2-SOLAR-10.7B、InternLM2-Chat-20B、Mixtral-8x7B-Instruct 和 Qwen-1.5-Chat-72B。在两个指令遵循基准测试 AlpacaEval 2.0 和 MT-Bench 上的实验结果表明 FuseChat-7B 优于各种规模的基线模型。我们的模型甚至可与更大的 Mixtral-8x7B-Instruct 相媲美,并在 MT-Bench 上接近 GPT-3.5-Turbo-1106。我们的代码、模型权重和数据公开在 https://github.com/fanqiwan/FuseAI。

关键词

引用

@article{arxiv.2408.07990,
  title  = {FuseChat: Knowledge Fusion of Chat Models},
  author = {Fanqi Wan and Longguang Zhong and Ziyi Yang and Ruijun Chen and Xiaojun Quan},
  journal= {arXiv preprint arXiv:2408.07990},
  year   = {2024}
}

备注

Work in progress