基于FusionRoute的Token级LLM协作
人工智能
2026-05-22 v4 计算与语言
机器学习
摘要
大型语言模型(LLM)在各个领域展现出优势。然而,使用单一通用模型在这些领域实现强大性能,通常需要扩展到训练和部署成本高昂的规模。另一方面,虽然较小的领域专用模型效率更高,但它们难以在训练分布之外进行泛化。为了解决这一困境,我们提出了FusionRoute,这是一个稳健且有效的Token级多LLM协作框架,其中轻量级路由器同时(i)在每个解码步骤选择最合适的专家,并且(ii)通过logit相加提供一个互补的logit,以细化或纠正所选专家的下一个Token分布。与仅依赖固定专家输出的现有Token级协作方法不同,我们提供了理论分析表明,纯专家路由存在根本局限性:除非满足强全局覆盖假设,否则它通常无法实现最优解码策略。通过使用可训练的互补生成器来增强专家选择,FusionRoute扩展了有效的策略类,并能够在温和条件下恢复最优值函数。在实验上,跨越Llama-3和Gemma-2系列以及涵盖数学推理、代码生成和指令遵循的多种基准测试,FusionRoute优于序列级和Token级协作、模型合并以及直接微调,同时在各自任务上与领域专家保持竞争力。
引用
@article{arxiv.2601.05106,
title = {Token-Level LLM Collaboration via FusionRoute},
author = {Nuoya Xiong and Yuhang Zhou and Hanqing Zeng and Zhaorun Chen and Furong Huang and Shuchao Bi and Lizhu Zhang and Zhuokai Zhao},
journal= {arXiv preprint arXiv:2601.05106},
year = {2026}
}
备注
25 pages