RoBoN:面向多 LLM 测试时扩展的路由在线最佳-n
机器学习
2025-12-08 v1 人工智能
摘要
最佳-n(best-of-n)是 LLM 推理中常用的测试时扩展方法。然而,尽管已证实 LLM 在不同任务上表现出互补优势,传统方法仍依赖单个模型生成响应。我们提出了 RoBoN(Routed Online Best-of-n),一种用于多 LLM 测试时扩展的顺序方法。给定模型集合 ,RoBoN 依据使用奖励模型和对预测响应一致性信号计算的得分,依次将生成路由到各个模型。这种在线路由无需额外训练,保持计算公平性,并且可与任何可插拔奖励模型配合。在推理基准(MATH500、OlympiadBench、MinervaMath、GSM8K、MMLU)上,RoBoN 在 larger 时始终优于应用于每个单个模型的标准 best-of-n,准确率提升最高可达 3.4个百分点,也优于均匀多模型组合基线。我们的结果表明,模型之间的多样性可以在推理时被利用,以提升 best-of-n 性能,超越任何单个组成模型,从而为多 LLM 测试时扩展提供一条简单且无需训练的路径。
引用
@article{arxiv.2512.05542,
title = {RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs},
author = {Jonathan Geuter and Gregor Kornhardt},
journal= {arXiv preprint arXiv:2512.05542},
year = {2025}
}
备注
20 pages, 3 figures. 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models