中文

路由至专家:基于奖励引导的大语言模型高效集成

计算与语言 2023-11-16 v1 机器学习

摘要

大语言模型(LLM)的互补潜力假定现成 LLM 在广泛领域和任务上具有异质化专长,从而 LLM 集成能够持续取得更优性能。现有 LLM 集成方法主要关注对输出的奖励模型排序,导致显著的计算开销。为应对该问题,我们重新审视 LLM 的互补潜力,并通过利用现成奖励模型挖掘潜在专长对其进行进一步阐释。我们提出 Zooter,一种奖励引导的路由方法,其在训练查询上提炼奖励以训练路由函数,从而能够将每个查询精确分发给具备相关专长的 LLM。我们还集成了基于标签的标签增强,以缓解使用奖励作为银监督时由不确定性带来的噪声。Zooter 在推理中表现出计算效率,因为与奖励模型排序方法相比,其仅引入路由函数的微小计算开销。我们在涵盖不同领域和任务 26 个子集的综合基准集合上评估 Zooter。Zooter 平均优于最佳单一模型,并在 44% 的任务上排名第一,甚至超越多种奖励模型排序方法。

关键词

引用

@article{arxiv.2311.08692,
  title  = {Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models},
  author = {Keming Lu and Hongyi Yuan and Runji Lin and Junyang Lin and Zheng Yuan and Chang Zhou and Jingren Zhou},
  journal= {arXiv preprint arXiv:2311.08692},
  year   = {2023}
}