推测式奖励模型以低成本提升 LLM 的决策能力
计算与语言
2025-06-03 v1
摘要
大型语言模型 (LLM) 中的有效决策对于处理复杂任务至关重要。然而,现有方法优先考虑性能,却往往忽视了有效性与计算成本之间的平衡。为解决这一问题,我们首先提出 3E 准则以系统地评估搜索策略的成本效益,揭示了现有方法常以显著的效率换取边际性能提升。为在保持效率的同时改善 LLM 的决策能力,我们提出了推测式奖励模型 (Speculative Reward Model, SRM),这是一种可无缝集成至现有搜索策略的即插即用框架。具体而言,SRM 采用外部奖励分配器来预测最优动作,从而减少对 LLM 内部自评估的依赖;同时利用推测式验证机制来剪枝次优选择,引导搜索走向更具前景的步骤。我们在数学推理、规划以及特定领域数值推理等多个复杂决策任务上对 SRM 进行了评估。实验结果表明,SRM 在保持有效性的同时,平均将成本降至原始搜索框架的 1/10。
引用
@article{arxiv.2506.00396,
title = {Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively},
author = {Jiawei Gu and Shangsong Liang},
journal= {arXiv preprint arXiv:2506.00396},
year = {2025}
}
备注
ACL2025 Oral (Industry Track)