中文

利用奖励引导的树搜索增强 LLM 推理

计算与语言 2025-01-03 v4 人工智能

摘要

近期,测试时缩放引起了研究界的广泛关注,这主要归功于 OpenAI 发布的 o1 模型取得的重大进展。通过在推理阶段分配更多计算资源,大语言模型(LLM)可以通过生成更多思维 token 或多样化解来广泛探索解空间,从而产生更准确的回答。然而,开发类 o1 的推理方法具有挑战性,研究人员一直在进行各种尝试以推进这一开放的研究领域。在本文中,我们对通过奖励引导的树搜索算法增强 LLM 的推理能力进行了初步探索。该框架通过集成策略模型、奖励模型与搜索算法来实现。它主要围绕树搜索算法构建,其中策略模型在经过专门训练的奖励模型引导下,在一个动态扩展的树中进行导航。该实现的框架被记为 \textbf{STILL-1}。我们深入探讨了实现该框架所需的各种设计考量,并提供了技术方面的详细报告。为了评估我们方法的有效性,我们聚焦于数学推理任务,并在四个具有挑战性的数据集上进行了广泛评估,显著增强了 LLM 的推理能力。

关键词

引用

@article{arxiv.2411.11694,
  title  = {Enhancing LLM Reasoning with Reward-guided Tree Search},
  author = {Jinhao Jiang and Zhipeng Chen and Yingqian Min and Jie Chen and Xiaoxue Cheng and Jiapeng Wang and Yiru Tang and Haoxiang Sun and Jia Deng and Wayne Xin Zhao and Zheng Liu and Dong Yan and Jian Xie and Zhongyuan Wang and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2411.11694},
  year   = {2025}
}

备注

Technical Report on Slow Thinking with LLMs: I