中文

当动作教会你思考:通过强化学习实现推理-行动协同的对话式智能体

计算与语言 2025-12-15 v1 机器学习

摘要

监督微调(SFT)已成为提高大语言模型(LLM)在下游任务中性能的最有效方法之一。然而,SFT 在数据分布发生变化时难以泛化,即使新数据不完全超出训练领域。近期推理导向模型如 o1 和 R1 在非推理模型之外持续取得显著收益,凸显推理对改进泛化性和可靠性的重要性。然而,为 SFT 收集高质量推理痕迹 remains 挑战——标注成本高、主观性强且难以规模化。为此,我们利用强化学习(RL)使模型能够从任务结果中直接学习推理策略。我们提出一种管道,使 LLM 生成引导工具调用(如函数调用)和最终答案生成的推理步骤。该方法采用组相对策略优化(GRPO),奖励设计围绕工具准确性和答案正确性,使模型不断迭代地 refined its reasoning and actions。实验结果表明,我们的方法在推理质量和工具调用精度方面均取得改善,相对于 SFT 模型(无显式思考训练)提升1.5%,相对于基础 Qwen3-1.7B 模型提升40%。这些发现彰显了通过 RL 统一推理与行动学习以构建更具能力和可泛化性对话式智能体的潜力。

关键词

引用

@article{arxiv.2512.11277,
  title  = {When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents},
  author = {Mrinal Rawat and Arkajyoti Chakraborty and Neha Gupta and Roberto Pieraccini},
  journal= {arXiv preprint arXiv:2512.11277},
  year   = {2025}
}