中文

解密RLHF:对大语言模型基于人类反馈的强化学习的批判性分析

机器学习 2024-04-17 v2 人工智能 计算与语言

摘要

最先进的大语言模型(LLM)已成为各种任务不可或缺的工具。然而,训练LLM使其成为人类的有效助手需要谨慎考量。一种有前景的方法是基于人类反馈的强化学习(RLHF),它利用人类反馈根据人类偏好更新模型,并缓解毒性和幻觉等问题。然而,对LLM的RLHF的理解在很大程度上与使该方法普及的初始设计选择纠缠在一起,且当前的研究侧重于增强这些选择,而不是从根本上改进该框架。在本文中,我们透过强化学习原理的视角分析RLHF以发展对其基础的理解,并将大量焦点放在RLHF的核心组件——奖励模型上。我们的研究考察了建模选择、函数近似的缺陷及其对RLHF训练算法的影响,突出了对奖励表达能力所作的潜在假设。我们的分析提升了对奖励模型作用及其训练方法的理解,同时揭示了当前方法论的局限性。我们表征了这些局限性,包括错误泛化、模型误设和反馈稀疏性,及其对语言模型性能的影响。讨论和分析得到了对当前文献的分类综述的支持,可作为研究人员和从业者理解RLHF挑战并在现有工作基础上继续构建的参考。

关键词

引用

@article{arxiv.2404.08555,
  title  = {RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs},
  author = {Shreyas Chaudhari and Pranjal Aggarwal and Vishvak Murahari and Tanmay Rajpurohit and Ashwin Kalyan and Karthik Narasimhan and Ameet Deshpande and Bruno Castro da Silva},
  journal= {arXiv preprint arXiv:2404.08555},
  year   = {2024}
}