基于人类反馈的强化学习:通过悲观主义学习动态选择
机器学习
2023-07-04 v3 人工智能
最优化与控制
统计理论
机器学习
统计理论
摘要
本文研究基于人类反馈的离线强化学习(RLHF),旨在从一组由人类选择诱导的轨迹中学习人类的潜在奖励与MDP的最优策略。RLHF因多重原因而具挑战性:状态空间大但人类反馈有限、人类决策的有限理性,以及离屏策略分布偏移。本文聚焦于用于建模和理解人类选择的动态离散选择(DDC)模型。DDC根植于计量经济学与决策理论,被广泛用于建模具有前瞻性与有限理性的人类决策过程。我们提出一种\underline{D}ynamic-\underline{C}hoice-\underline{P}essimistic-\underline{P}olicy-\underline{O}ptimization(DCPPO)方法。该方法包含三阶段过程:第一步通过最大似然估计(MLE)估计人类行为策略与状态-动作值函数;第二步利用所学值函数最小化Bellman均方误差以恢复人类奖励函数;第三步代入所学奖励并调用悲观值迭代以寻找近最优策略。在数据集仅具单策略覆盖(即最优策略)的条件下,我们证明DCPPO的次优性在关于分布偏移与维度的依赖上几乎匹配经典的悲观离线RL算法。据我们所知,本文给出了首个针对采用动态离散选择模型的离屏离线RLHF的理论保证。
引用
@article{arxiv.2305.18438,
title = {Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism},
author = {Zihao Li and Zhuoran Yang and Mengdi Wang},
journal= {arXiv preprint arXiv:2305.18438},
year = {2023}
}