中文

基于强化学习与推理时缩放定律的慢思考推理大语言模型综述

人工智能 2025-05-09 v2

摘要

本综述探讨了旨在模拟“慢思考”的推理大语言模型的最新进展——这是一种受人类认知启发的推理过程,如卡尼曼的《思考,快与慢》所述。这些模型,如OpenAI的o1,专注于在复杂任务(如数学推理、视觉推理、医学诊断和多智能体辩论)中动态扩展计算资源。我们介绍了推理大语言模型的发展并列举了其关键技术。通过综合100多项研究,本综述描绘了一条将类人深度思考与可扩展推理效率相结合的大语言模型发展路径。本综述将方法分为三类:(1)测试时缩放,通过搜索和采样、动态验证,根据任务复杂度动态调整计算;(2)强化学习,通过利用策略网络、奖励模型和自我进化策略的迭代改进来优化决策;(3)慢思考框架(例如,长思维链、分层过程),以可管理的步骤构建问题解决过程。本综述强调了该领域的挑战和未来方向。理解并提升大语言模型的推理能力,对于释放其在从科学发现到决策支持系统等现实应用中的全部潜力至关重要。

关键词

引用

@article{arxiv.2505.02665,
  title  = {A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law},
  author = {Qianjun Pan and Wenkai Ji and Yuyang Ding and Junsong Li and Shilian Chen and Junyi Wang and Jie Zhou and Qin Chen and Min Zhang and Yulan Wu and Liang He},
  journal= {arXiv preprint arXiv:2505.02665},
  year   = {2025}
}