聊天大语言模型的知识融合:初步技术报告
计算与语言
2024-06-05 v6
摘要
最近,FuseLLM 引入了知识融合的概念,通过轻量级持续训练将多个结构各异的大语言模型 (LLM) 的集体知识转移到目标 LLM 中。在本报告中,我们扩展了 FuseLLM 框架的可扩展性和灵活性,以实现聊天 LLM 的融合,从而产生了 FusionChat。FusionChat 包含两个主要阶段。首先,我们对结构和规模各异的源 LLM 进行知识融合,通过轻量级微调导出多个结构和大小相同的目标 LLM。然后,在参数空间内合并这些目标 LLM,在此过程中,我们提出了一种基于微调前后参数矩阵变化率来确定合并权重的新方法。我们使用了三个具有不同架构和规模的著名聊天 LLM 验证了我们的方法,即 NH2-Mixtral-8x7B、NH2-Solar-10.7B 和 OpenChat-3.5-7B。跨越各种聊天领域的实验结果表明,FusionChat-7B 在 7B 和 34B 规模的广泛聊天 LLM 中表现出优越性,甚至超越了 GPT-3.5 (March) 并接近 Mixtral-8x7B-Instruct。
引用
@article{arxiv.2402.16107,
title = {Knowledge Fusion of Chat LLMs: A Preliminary Technical Report},
author = {Fanqi Wan and Ziyi Yang and Longguang Zhong and Xiaojun Quan and Xinting Huang and Wei Bi},
journal= {arXiv preprint arXiv:2402.16107},
year = {2024}
}
备注
Technical Report, work in progress