迈向大型推理模型:大型语言模型的强化推理综述
人工智能
2025-01-24 v3 计算与语言
摘要
语言长期以来被视为人类推理的重要工具。Large Language Models (LLMs) 的突破引发了利用这些模型来解决复杂推理任务的重大研究兴趣。研究人员通过引入“思维”的概念——即代表推理过程中间步骤的标记序列——超越了简单的自回归标记生成。这种创新范式使 LLMs 能够模拟复杂的人类推理过程,如树搜索和反思性思维。最近,“学习推理”的新趋势应用强化学习 (RL) 来训练 LLMs 掌握推理过程。这种方法通过试错搜索算法自动生成高质量的推理轨迹,通过提供大量训练数据显著扩展了 LLMs 的推理能力。此外,最近的研究表明,鼓励 LLMs 在测试时推理中使用更多标记进行“思考”可以进一步显著提升推理准确率。因此,训练时和测试时的扩展共同展现了一个新的研究前沿——通向大型推理模型的路径。OpenAI o1 系列的推出标志着这一研究方向的重要里程碑。在本综述中,我们全面回顾了 LLM 推理的最新进展。我们首先介绍 LLMs 的基础背景,然后探讨推动大型推理模型发展的关键技术组件,重点关注自动化数据构建、学习推理技术和测试时扩展。我们还分析了构建大型推理模型的流行开源项目,并总结了开放挑战与未来研究方向。
引用
@article{arxiv.2501.09686,
title = {Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models},
author = {Fengli Xu and Qianyue Hao and Zefang Zong and Jingwei Wang and Yunke Zhang and Jingyi Wang and Xiaochong Lan and Jiahui Gong and Tianjian Ouyang and Fanjin Meng and Chenyang Shao and Yuwei Yan and Qinglong Yang and Yiwen Song and Sijian Ren and Xinyuan Hu and Yu Li and Jie Feng and Chen Gao and Yong Li},
journal= {arXiv preprint arXiv:2501.09686},
year = {2025}
}
备注
36 pages, 5 figures