可学习文本反馈的强化学习:一个双层方法
机器学习
2026-05-26 v1
摘要
具有可验证奖励的强化学习可以提高LLM的推理能力,但当终端奖励稀疏时,学习效率仍然较低。这促使了越来越多的工作关注带文本反馈的强化学习,其中批评模型生成自然语言反馈以指导推理模型(演员),将标量奖励与更丰富的学习信号相结合。然而,现有方法通常将反馈视为固定或辅助的,这忽略了一个关键属性:反馈不仅要正确,还要在提供上下文的情况下能够提高策略(演员模型)。这就动机了一个面向可学习文本反馈的强化学习范式。然而,反馈的可学习性和有用性取决于策略从反馈中学习的能力,这使得可学习反馈的强化学习本质上是一个双层问题。我们将这种耦合形式化为堆栈尔堡双层计划,并推导出双层自然语言演员-评论家(Bi-NAC),该方法联合训练批评模型以生成可提高奖励的反馈,以及演员模型以利用这种反馈。在MATH-500、MBPP和GPQA等基准测试上,Bi-NAC在样本和参数效率方面优于强化学习和固定批评基准:我们的2B模型超过3B GRPO基准,在MATH-500上达到46.6%,而我们的6B模型超越7B GRPO基准,在GPQA上达到49.3%。
引用
@article{arxiv.2605.24547,
title = {RL with Learnable Textual Feedback: A Bilevel Approach},
author = {Utsav Singh and Sidhaarth Sredharan and Souradip Chakraborty and Amrit Singh Bedi},
journal= {arXiv preprint arXiv:2605.24547},
year = {2026}
}