通过文本反馈扩展强化学习的能力
机器学习
2026-02-12 v2
摘要
RL for LLM post-training 的成功归因于一个异常不信息的来源:仅每一次 rollout 提供一个二进制奖励或偏好标签。另一端,蒸馏提供稠密监督,但需要演示,成本高昂且难以规模化。我们研究文本反馈作为中间信号:比标量奖励更丰富,却比完整演示更便宜。文本反馈是人类自然交互的一种方式,已在许多真实场景中广泛存在,用户、标注员和自动裁判经常对 LLM 输出进行批评。为了在大规模条件下利用文本反馈,我们正式化了一个多轮 RL 设置,即从文本反馈获得 RL (RLTF),在训练期间可用文本反馈,但推理时不可用。因此,模型必须学习内化反馈以提高其测试时单轮性能。为此,我们提出了两种方法:自蒸馏 (RLTF-SD),训练单轮策略以匹配其自身反馈条件下的第二轮生成;反馈建模 (RLTF-FM),作为辅助目标预测反馈。我们对两种方法提供了理论分析,并在推理谜题、竞赛数学和创意写作任务上进行了实证评估。我们的结果显示,两种方法在各类基准测试中均一致优于强大基线,凸显了 RL 在大规模条件下获得额外监督来源的潜力。
引用
@article{arxiv.2602.02482,
title = {Expanding the Capabilities of Reinforcement Learning via Text Feedback},
author = {Yuda Song and Lili Chen and Fahim Tajwar and Remi Munos and Deepak Pathak and J. Andrew Bagnell and Aarti Singh and Andrea Zanette},
journal= {arXiv preprint arXiv:2602.02482},
year = {2026}
}
备注
43 pages, 6 figures