中文

DialogueReason:基于规则的强化学习驱动对话式推理中的语言模型

人工智能 2025-05-13 v1

摘要

我们提出了 DialogueReason,这是一种推理范式,旨在揭示单语式推理模型中被遗漏的角色,以提升推理过程的多样性和连贯性。近期基于强化学习的大规模推理模型取得了显著的长程链式推理能力,在数学和科学基准测试中取得了高性能。然而,这些推理模型主要依赖单语式推理,常常限制了推理的多样性和连贯性,频繁重复固定策略或表现出不必要的注意力转移。我们的工作包括对单语推理模式的分析以及基于对话的推理方法的开发。我们首先引入 Compound-QA 任务,将多个问题拼接到单个提示中,以评估推理的多样性和连贯性。我们的分析表明,Compound-QA 揭示了单语推理的弱点,由定量指标和定性推理痕迹均有所体现。基于此分析,我们提出一种基于对话的推理方法,命名为 DialogueReason,其结构围绕智能体、环境和交互。使用带规则奖励的 PPO,我们训练开源语言模型(Qwen-QWQ 和 Qwen-Base)以采用对话式推理。我们在 MATH、AIME 和 GPQA 数据集上对训练后的模型进行评估,结果表明,在更复杂的复合问题下,基于对话的推理模型优于单语模型。此外,我们讨论了基于对话的推理如何有助于提高可解释性,促进更直观的人类交互,并激发多智能体系统设计的进步。

关键词

引用

@article{arxiv.2505.07049,
  title  = {DialogueReason: Rule-Based RL Sparks Dialogue Reasoning in LLMs},
  author = {Yubo Shu and Zhewei Huang and Xin Wu and Chen Hu and Shuchang Zhou and Daxin Jiang},
  journal= {arXiv preprint arXiv:2505.07049},
  year   = {2025}
}