中文

Cool-Fusion:无需训练的大语言模型融合

计算与语言 2025-06-10 v2

摘要

本文聚焦于解决两个或多个异构大语言模型(LLM)融合的问题,以利用其互补的优势。模型融合的一个挑战是高计算负载, Specifically 在微调或对齐词汇表方面。为此,我们提出了 Cool-Fusion,一种无需训练即可融合源 LLM 知识的简单而有效的方法。不同于集成方法,Cool-Fusion 可以适用于词汇表不同的任意源 LLM 集合。为克服 LLM 之间词汇表的差异,我们在文本层面对 LLM 进行集成,允许它们以不同粒度对彼此生成的文本进行重新排序。我们在广泛的基准数据集上进行了大量实验。在 GSM8K 上,Cool-Fusion 将来自三个强大源 LLM 的准确率提高了显著的 17.4%。

关键词

引用

@article{arxiv.2407.19807,
  title  = {Cool-Fusion: Fuse Large Language Models without Training},
  author = {Cong Liu and Xiaojun Quan and Yan Pan and Liang Lin and Weigang Wu and Xu Chen},
  journal= {arXiv preprint arXiv:2407.19807},
  year   = {2025}
}