中文

能够思考的语言模型,聊天更出色

计算与语言 2025-09-25 v1

摘要

基于可验证奖励的强化学习(RLVR)通过使用基于规则的奖励来提升语言模型在数学和代码等可验证领域的推理能力。然而,RLVR 在开放式任务——如撰写大纲文章或制定膳食计划——上的泛化能力有限,而人类在这些任务上 routinely 进行推理。本文表明 RLVR 范式在可验证领域之外同样有效,并提出了用于通用聊天能力的**基于模型奖励的思考强化学习(RLMT)**。利用多样化的真实世界提示,RLMT 要求语言模型在生成回复前进行长链思考推理,并通过基于偏好的奖励模型(以 RLHF 中使用的奖励模型为基础)进行在线强化学习优化。在对 Llama-3.1-8B 和 Qwen-2.5-7B(均包含基础模型和指令模型)的 40 次训练运行以及多种优化算法(DPO、PPO 和 GRPO)上,RLMT 一致优于标准的 RLHF 流水线。这包括在三个聊天基准测试(AlpacaEval2、WildBench 和 ArenaHardV2)上取得了 3-7 分的显著提升,以及在创意写作和通用知识等其他任务上取得了 1-3 分的提升。我们最好的 8B 模型在聊天和创意写作方面超越了 GPT-4o,并与 Claude-3.7-Sonnet(Thinking)不相上下。RLMT 也可以直接应用于基础模型而无需 SFT 阶段,类似于 R1-Zero 训练。值得注意的是,仅使用 7K 个提示,用我们 RLMT 方案训练的 Llama-3.1-8B 基础模型就超越了经过复杂多阶段流水线(使用 2500 万+ 样本)后训练的 Llama-3.1-8B-Instruct。我们以对训练模型如何规划回复的定性和定量分析作为结尾。我们的结果重新审视了后训练流水线,并呼吁未来工作更广泛地理解和运用思考能力。

关键词

引用

@article{arxiv.2509.20357,
  title  = {Language Models that Think, Chat Better},
  author = {Adithya Bhaskar and Xi Ye and Danqi Chen},
  journal= {arXiv preprint arXiv:2509.20357},
  year   = {2025}
}

备注

Preprint; we release our code and models publicly at https://github.com/princeton-pli/RLMT