推理语言模型:蓝图
人工智能
2025-06-12 v4 计算与语言
摘要
推理语言模型 (RLMs),也称为大型推理模型 (LRMs),如OpenAI的o1和o3、DeepSeek-R1和阿里巴巴的QwQ,已通过扩展语言模型并引入先进推理机制,重新定义了人工智能的问题解决能力。然而,这些模型的高成本、专有属性和复杂架构——独特地结合了强化学习 (RL)、搜索启发式方法和语言模型——带来了可及性和可扩展性挑战。为此,我们提出了一套全面的蓝图,将RLM组件组织成模块化框架,基于对所有RLM工作的调查与分析。该蓝图包含多样化的推理结构(链、树、图和嵌套形式)、推理策略(如蒙特卡洛树搜索、束搜索)、RL概念(政策、价值模型等)、监督方案(结果为导向和过程为导向)以及其他相关概念(如测试时计算、检索增强生成、智能体工具)。我们提供详细的数学公式和算法规范,以简化RLM的实现。通过展示LLaMA-Berry、QwQ、Journey Learning和图形思维等方案如何作为特殊案例,我们证明了该蓝图的灵活性和统一潜力。为说明其实用性,我们引入x1,一个用于快速RLM原型设计和实验的模块化实现。借助x1和文献综述,我们提供关键见解,如政策和价值模型的多阶段训练,以及熟悉训练分布的重要性。最后,我们讨论了可扩展的RLM云端部署,阐述了RLM如何集成到更广泛的LLM生态系统中。我们的工作解构了RLM构建, democratizes(民主化)先进的推理能力,促进了创新,旨在通过降低RLM设计和实验的门槛,缩小“富裕AI”和“贫困AI”之间的差距。
引用
@article{arxiv.2501.11223,
title = {Reasoning Language Models: A Blueprint},
author = {Maciej Besta and Julia Barth and Eric Schreiber and Ales Kubicek and Afonso Catarino and Robert Gerstenberger and Piotr Nyczyk and Patrick Iff and Yueling Li and Sam Houliston and Tomasz Sternal and Marcin Copik and Grzegorz Kwaśniewski and Jürgen Müller and Łukasz Flis and Hannes Eberhard and Zixuan Chen and Hubert Niewiadomski and Torsten Hoefler},
journal= {arXiv preprint arXiv:2501.11223},
year = {2025}
}