ChatR1:基于强化学习的对话推理与检索增强问答
计算与语言
2026-04-28 v2 信息检索
摘要
我们提出ChatR1,一个基于强化学习(RL)的对话问答(CQA)推理框架。推理在CQA中占据重要位置,其中用户意图在对话轮次中演变, utterance 常常不够明确,需要上下文解释、查询改写和检索与生成之间的动态协调。不同于静态的'rewrite, retrieve, and generate'管线,ChatR1在轮次之间交叉进行搜索与推理,实现探索性和自适应行为,这些行为通过RL学习。为解决RL中稀疏和延迟奖励的挑战,我们提出一种意图感知奖励,通过将检索与推理与不断演变的用户目标对齐来提供轮次级反馈。ChatR1在3B和7B模型 Backbone 上均表现出色,在五个CQA数据集上 outperform 竞争模型,测度指标包括F1、BERTScore和LLM-as-judge。我们包括多样化的CQA数据集,以覆盖主题转移、意图演变、混合授权对话以及多文档 grounding,测试ChatR1从多个方面表现。消融研究确认意图感知奖励的有效性。我们的分析进一步揭示了多样化的推理轨迹和有效的搜索工具使用。ChatR1在多个领域中都能稳健地泛化,表明RL驱动的推理比静态CQA管线更具灵活性和上下文感知能力。
引用
@article{arxiv.2510.13312,
title = {ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering},
author = {Simon Lupart and Mohammad Aliannejadi and Evangelos Kanoulas},
journal= {arXiv preprint arXiv:2510.13312},
year = {2026}
}
备注
18 pages, 9 figures, Main ACL 2026 Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, July 2--7, 2026, San Diego, California