通过直接 Q 函数优化提升语言模型的多步推理能力
机器学习
2025-02-12 v2 人工智能
计算与语言
摘要
强化学习(RL)在与人类偏好一致化大型语言模型(LLM)和提高其执行复杂任务能力方面发挥着关键作用。然而,当前方法要么由于使用多个模型和大量在线抽样训练而需要巨大的计算资源(如 PPO),要么被建模为赤字问题(如 DPO、DRO),这类方法在诸如数学问题解决和涉及长链思考的复杂推理等多步骤推理任务中常常棱子。为克服这些限制,我们引入直接 Q 函数优化(DQO),将响应生成过程建模为马尔可夫决策过程(MDP),并利用软演员-评论家(SAC)框架优化由语言模型参数化的 Q 函数。DQO 的 MDP 建模相对于赤字方法具有结构优势,实现了更有效的过程监督。在两个数学问题解决数据集 GSM8K 和 MATH 上的实验结果表明,DQO 优于先前方法,证明其作为语言模型对齐的有前景的离线强化学习方法。
引用
@article{arxiv.2410.09302,
title = {Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization},
author = {Kaixuan Ji and Guanlin Liu and Ning Dai and Qingping Yang and Renjie Zheng and Zheng Wu and Chen Dun and Quanquan Gu and Lin Yan},
journal= {arXiv preprint arXiv:2410.09302},
year = {2025}
}