中文

人类反馈强化学习综述

机器学习 2025-12-30 v3

摘要

人类反馈强化学习 (RLHF) 是强化学习 (RL) 的一种变体,它从人类反馈中学习,而不是依赖于工程化的奖励函数。它建立在偏好强化学习 这一相关设定的先前工作之上,处于人工智能与人机交互的交叉点。这一定位提供了一种有前景的方法,既能提高智能系统的性能和适应性,又能改善其目标与人类价值观的对齐。近年来,在训练大语言模型 方面取得的成功令人瞩目地展示了这一潜力,其中 RLHF 在将模型的能力引向人类目标方面发挥了决定性作用。本文概述了 RLHF 的基础知识,探讨了 RL 智能体如何与人类反馈进行交互。尽管近期的关注点集中在 LLM 的 RLHF 上,但我们的综述涵盖了多个领域的技术。我们在控制和机器人领域提供了最全面的覆盖,许多基础技术均源于此,并附带专门的 LLM 章节。我们研究了支撑 RLHF 的核心原则、算法与人类反馈如何协同工作,以及该领域的主要研究趋势。我们的目标是让研究人员和从业者对这个快速发展的领域有一个清晰的认识。

关键词

引用

@article{arxiv.2312.14925,
  title  = {A Survey of Reinforcement Learning from Human Feedback},
  author = {Timo Kaufmann and Paul Weng and Viktor Bengs and Eyke Hüllermeier},
  journal= {arXiv preprint arXiv:2312.14925},
  year   = {2025}
}

备注

Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b