通过强化学习增强链路思维推理质量:重新思考大语言模型的推理质量
人工智能
2025-09-09 v1
摘要
强化学习(RL)最近成为增强大语言模型(LLMs)推理能力的主导范式。然而,常用于数学或编程基准的基于规则的奖励函数仅评估答案格式和正确性,无法提供链路思维(Chain-of-Thought, CoT)是否实际改善答案的信号。此外,这类任务特定的训练对逻辑深度控制有限,可能无法揭示模型的真正推理能力。我们提出动态推理效率奖励(Dynamic Reasoning Efficiency Reward, DRER)——一种即插即用的数据驱动 RL 奖励框架,重新塑造奖励和优势信号。(i) 推理质量奖励(Reasoning Quality Reward)为那些显著提升正确答案概率的推理链分配细粒度信用,直接激励对有益 CoT 标记的轨迹。(ii) 动态长度优势(Dynamic Length Advantage)衰减偏离验证导出阈值的响应长度,以稳定训练。为促进严格评估,我们也发布了 Logictree——一个动态构建的演绎推理数据集,既可作为 RL 训练数据,也可作为综合性基准。实验表明,DRER有效果:我们的 7B 模型在 Logictree 上仅通过 400 个训练步骤即可达到 GPT-o3-mini 水平,而 CoT 增强答案的平均置信度提升了 30%。该模型还在 diverse logical-reasoning 数据集和数学基准 AIME24 上表现出泛化。这些结果阐明了 RL 如何塑造 CoT 行为,并为增强大语言模型的形式推理能力指明了实用路径。所有代码和数据均已发布于仓库 https://github.com/Henryhe09/DRER。
引用
@article{arxiv.2509.06024,
title = {Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL},
author = {Haoyang He and Zihua Rong and Kun Ji and Chenyang Li and Qing Huang and Chong Xia and Lan Yang and Honggang Zhang},
journal= {arXiv preprint arXiv:2509.06024},
year = {2025}
}