中文

MulFeRL:通过多轮对话增强基于语言反馈的强化学习

人工智能 2026-02-02 v1

摘要

基于可验证奖励的强化学习(RLVR)在多个领域用于提高推理能力,然而仅基于结果的稀疏且缺乏信息的标量奖励尤其在失败样本上表现不佳,这些样本仅指示失败,却不提供为何导致推理失败的线索。在本文中,我们研究如何利用更丰富的语言反馈来指导RLVR在失败样本上的训练,以及如何将此类反馈转换为可训练的学习信号。具体而言,我们提议一种多轮反馈引导的强化学习框架。该框架基于三个机制:(1)基于反馈的动态多轮再生成,仅在失败样本上触发;(2)用于在轮内和跨轮优化的两种互补学习信号;(3)将结构化反馈注入模型的推理过程中。我们在抽样的OpenR1-Math数据集上进行训练,结果在原领域内外均优于监督微调和RLVR基线方法。

关键词

引用

@article{arxiv.2601.22900,
  title  = {MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop},
  author = {Xuancheng Li and Haitao Li and Yujia Zhou and YiqunLiu and Qingyao Ai},
  journal= {arXiv preprint arXiv:2601.22900},
  year   = {2026}
}