中文

SpecFuse: 通过下一段预测集成大语言模型

计算与语言 2026-03-09 v3 人工智能

摘要

生成式大语言模型(LLMs)的集成是一种有前景的补偿个体模型局限性的方法,能够整合不同 LLMs 的优势。然而,现有 LLM 集成方法面临首 token 延迟和模型间长程语义协作的挑战。此外,它们通常假设所有模型在集成时具有等权重投票,忽略了模型在任务特定性能上的差异。在本工作中,我们提出 SpecEM,一种无训练、即插即用的 LLM 集成框架,可根据任务性能实时动态调整各模型的贡献。借鉴推测解码的思想,SpecEM 迭代地执行草稿与验证,允许模型在段级别进行语义协作以实现集成输出。此外,我们引入一种在线反馈机制与乘性权重更新,在验证阶段根据各模型超越其他模型的频率实时调整其投票权重,确保更强的模型在集成中发挥更大影响。在五个 LLM 系列(从 7B 到 72B 参数)和六个基准数据集上的实验结果,覆盖开放域指令遵循、推理、常识等任务,均一致展示了相比现有最先进 LLM 集成方法的性能提升。我们的代码已发布于 https://github.com/lvbotenbest/SpecEM。

关键词

引用

@article{arxiv.2412.07380,
  title  = {SpecFuse: Ensembling Large Language Models via Next-Segment Prediction},
  author = {Bo Lv and Nayu Liu and Chen Tang and Xin Liu and Yue Yu and Ping Luo},
  journal= {arXiv preprint arXiv:2412.07380},
  year   = {2026}
}

备注

15 pages, 5 figures