FusionFactory:将 LLM 能力与多 LLM 日志数据相融合
机器学习
2025-09-30 v2
摘要
大型语言模型(LLM)的快速发展创造了多样化的模型生态系统,每个模型都在不同任务上表现突出。这一多样性促使研究人员在实际应用中使用多个 LLM,留下了宝贵的多 LLM 日志数据。这自然引出了一个问题:这些日志数据能否被充分利用来融合 LLM 的互补能力?尽管已探索了各种集成多个 LLM 的策略,但我们认为实际的融合必须满足两个基本要求:(1) 与实际部署场景兼容(例如本地部署和 API 部署),以及 (2) 能够在 LLM 管道的不同阶段灵活运行,以满足不同用户的需求(例如微调和推理阶段)。为此,我们引入 LLMFusionBench,这是一个大型基准,涵盖 14 个跨 5 个领域的任务,包含来自 20 个开源 LLM(规模从 8B 到 671B)的响应,总计 1030 万 token。基于 LLMFusionBench,我们提出了 FusionFactory,一个系统化的框架,包含三个详细的层次:(1) 通过量身定制的 LLM 路由器实现查询级融合,(2) 通过检索抽象推理模板实现思考级融合,以及 (3) 通过从最佳响应蒸馏实现模型级融合。实验表明,FusionFactory 在所有 14 个基准中都一致超过最佳单个 LLM, optimal fusion 配置在不同基准之间存在差异,这凸显了多 LLM 日志数据作为融合多样化 LLM 能力实用基础的前景。
引用
@article{arxiv.2507.10540,
title = {FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data},
author = {Tao Feng and Haozhen Zhang and Zijie Lei and Pengrui Han and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro and Jiaxuan You},
journal= {arXiv preprint arXiv:2507.10540},
year = {2025}
}