通过层次化检索增强 MCTS 提升大型语言模型的测试时间扩展性能
计算与语言
2025-07-09 v1
摘要
测试时间扩展已成为语言建模中的有前景的范式,利用推理时间的额外计算资源来增强模型性能。本文引入 R2-LLMs,一种新型且通用的层次化检索增强推理框架,旨在改进大型语言模型(LLMs)的测试时间扩展,无需通过来自更高级模型的蒸馏来获取链式思维(CoT)训练数据。R2-LLMs 通过集成双层检索式情境学习来增强推理时间的泛化能力:(1) 在粗粒度层面,方法从复杂推理问题中提取抽象模板并检索相似的解答对,以促进高层次情境学习;(2) 在细粒度层面,R2-LLMs 在蒙特卡洛树搜索(MCTS)期间高效检索类似中间解决方案步骤,借助过程奖励模型(PRM)对步骤进行打分,以细化逐步推理。R2-LLMs 是一种稳健的层次化推理增强方法,既增强情境层次的推理,又无缝集成于逐步层次的树搜索方法。利用 PRM,它既细化了候选生成,也改进了决策,从而提高推理准确性。在 MATH500、GSM8K 和 OlympiadBench-TO 数据集上的实证评估显示,使用 LLaMA-3.1-8B 相较于基线实现了最高可达 16% 的相对提升,彰显了该方法在复杂推理任务中的有效性。
引用
@article{arxiv.2507.05557,
title = {Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS},
author = {Alex ZH Dou and Zhongwei Wan and Dongfei Cui and Xin Wang and Jing Xiong and Haokun Lin and Chaofan Tao and Shen Yan and Mi Zhang},
journal= {arXiv preprint arXiv:2507.05557},
year = {2025}
}
备注
Technical Report