中文

具有人类反馈的鲁棒离线强化学习

机器学习 2024-02-13 v1 人工智能

摘要

我们研究了离线设置下具有人类反馈的强化学习 (RLHF) 的数据腐败鲁棒性。给定一个包含轨迹对及其人类偏好反馈的离线数据集,其中 ε\varepsilon 比例的轨迹对受到腐败(例如,反馈被翻转或轨迹特征被操纵),这捕捉了对抗性攻击或嘈杂的人类偏好。我们的目标是设计算法,从腐败数据中识别出近优策略,并提供可证明的保证。现有的理论工作分别研究了腐败鲁棒 RL(直接在腐败下从标量奖励中学习)和离线 RLHF(在无腐败情况下从人类反馈中学习)的设置;然而,它们不适用于我们在离线 RLHF 设置中处理腐败数据的问题。为此,我们在关于数据生成分布覆盖范围的各种假设下,设计了新颖的腐败鲁棒离线 RLHF 方法。总体而言,我们的方法首先学习带有置信集的奖励模型,然后在置信集上学习悲观最优策略,从而增强了离线 RLHF 框架。我们的关键见解是,可以根据数据覆盖假设,以不同方式(例如零阶 oracle 或一阶 oracle)利用离线腐败鲁棒 RL oracle 来完成最优策略的学习。据我们所知,这是第一项提供可证明的腐败鲁棒离线 RLHF 方法的工作。

关键词

引用

@article{arxiv.2402.06734,
  title  = {Corruption Robust Offline Reinforcement Learning with Human Feedback},
  author = {Debmalya Mandal and Andi Nika and Parameswaran Kamalaruban and Adish Singla and Goran Radanović},
  journal= {arXiv preprint arXiv:2402.06734},
  year   = {2024}
}