中文

语言模型无需标量奖励即可从言语反馈中学习

计算与语言 2025-09-29 v1 人工智能 机器学习

摘要

LLM 通常通过来自人类或 AI 反馈的 RL 进行训练,然而此类方法通常将细微的反馈压缩为标量奖励,丢弃了其大部分丰富性并导致尺度不平衡。我们提出将言语反馈作为条件信号。受文本到图像生成中语言先验的启发——该先验使得从未见过的提示生成新输出成为可能——我们引入了反馈条件策略(FCP)。FCP 直接从响应-反馈对中学习,通过对离线数据的最大似然训练来近似反馈条件后验。我们进一步开发了一个在线自举阶段,其中策略在正条件下生成并获得新的反馈以自我完善。这将反馈驱动的学习重新构建为条件生成而非奖励优化,为 LLM 直接从言语反馈中学习提供了一种更具表达力的方式。我们的代码可在 https://github.com/sail-sg/feedback-conditional-policy 获取。

关键词

引用

@article{arxiv.2509.22638,
  title  = {Language Models Can Learn from Verbal Feedback Without Scalar Rewards},
  author = {Renjie Luo and Zichen Liu and Xiangyan Liu and Chao Du and Min Lin and Wenhu Chen and Wei Lu and Tianyu Pang},
  journal= {arXiv preprint arXiv:2509.22638},
  year   = {2025}
}