强化学习与人类反馈的历史及风险
计算机与社会
2023-11-29 v2
摘要
基于人类反馈的强化学习(RLHF)已成为一种强大的技术,使大语言模型(LLMs)更易于使用且更有效。RLHF 过程的核心部分是训练并利用人类偏好模型,该模型充当优化的奖励函数。这种方法处于众多利益相关方与学科领域的交叉点,目前仍鲜为人知。RLHF 奖励模型常被认为是取得性能的关键,然而关于其能力、评估、训练方法或开源模型的描述极少。鉴于此类信息匮乏,需要对习得型 RLHF 奖励模型开展进一步研究与提高透明度。本文梳理了偏好优化的复杂历史,并阐明了用以理解奖励模型社会技术脉络的研究线索。我们特别强调了 RLHF 基础中成本、奖励与偏好之间存在的本体论差异,相关的方论张力,以及可增进对奖励模型运作机制普遍理解的可能研究方向。
引用
@article{arxiv.2310.13595,
title = {The History and Risks of Reinforcement Learning and Human Feedback},
author = {Nathan Lambert and Thomas Krendl Gilbert and Tom Zick},
journal= {arXiv preprint arXiv:2310.13595},
year = {2023}
}
备注
14 pages, 3 figures