Text2Grad:基于自然语言反馈的强化学习
计算与语言
2026-01-28 v2 人工智能
摘要
传统的 RLHF 使用粗粒度的标量奖励优化语言模型,掩盖了成功或失败背后的细粒度原因,导致学习过程缓慢且不透明。近期的工作通过提示或反思为 RL 增加了文本批评,提高了可解释性,但未改变模型参数。我们引入了 Text2Grad,这是一种将自由形式文本反馈转化为片段级梯度的强化学习范式。给定人类(或程序化)批评,Text2Grad 将每个反馈短语与相关的 token 片段对齐,将这些对齐转化为可微分的奖励信号,并执行梯度更新以直接改进模型策略中存在问题的部分。这产生了精确的、以反馈为条件的调整,而非全局微调。Text2Grad 通过三个组件实现:(1)将批评与 token 片段配对的高质量反馈标注流水线;(2)在生成解释性批评的同时预测答案片段级奖励的细粒度奖励模型;(3)反向传播自然语言梯度的片段级策略优化器。在摘要、代码生成和问答任务中,Text2Grad 始终优于标量奖励 RL 和仅使用提示的基线,提供了更高的任务指标和更丰富的可解释性。我们的结果表明,自然语言反馈不仅可以作为解释,还可以作为用于细粒度对齐的可操作训练信号。我们方法的代码可在 https://github.com/microsoft/Text2Grad 获取。
引用
@article{arxiv.2505.22338,
title = {Text2Grad: Reinforcement Learning from Natural Language Feedback},
author = {Hanyang Wang and Lu Wang and Chaoyun Zhang and Tianjun Mao and Si Qin and Qingwei Lin and Saravan Rajmohan and Dongmei Zhang},
journal= {arXiv preprint arXiv:2505.22338},
year = {2026}
}
备注
The code for our method is available at https://github.com/microsoft/Text2Grad