语言模型无需标量奖励即可从言语反馈中学习
计算与语言
2025-09-29 v1 人工智能
机器学习
摘要
LLM 通常通过来自人类或 AI 反馈的 RL 进行训练,然而此类方法通常将细微的反馈压缩为标量奖励,丢弃了其大部分丰富性并导致尺度不平衡。我们提出将言语反馈作为条件信号。受文本到图像生成中语言先验的启发——该先验使得从未见过的提示生成新输出成为可能——我们引入了反馈条件策略(FCP)。FCP 直接从响应-反馈对中学习,通过对离线数据的最大似然训练来近似反馈条件后验。我们进一步开发了一个在线自举阶段,其中策略在正条件下生成并获得新的反馈以自我完善。这将反馈驱动的学习重新构建为条件生成而非奖励优化,为 LLM 直接从言语反馈中学习提供了一种更具表达力的方式。我们的代码可在 https://github.com/sail-sg/feedback-conditional-policy 获取。
引用
@article{arxiv.2509.22638,
title = {Language Models Can Learn from Verbal Feedback Without Scalar Rewards},
author = {Renjie Luo and Zichen Liu and Xiangyan Liu and Chao Du and Min Lin and Wenhu Chen and Wei Lu and Tianyu Pang},
journal= {arXiv preprint arXiv:2509.22638},
year = {2025}
}