演示正则化强化学习
机器学习
2024-06-11 v2 机器学习
摘要
引入专家演示已在经验上有助于提升强化学习(RL)的样本效率。本文从理论上量化了这一额外信息在多大程度上降低了 RL 的样本复杂度。具体而言,我们研究演示正则化强化学习,其通过 KL 正则化利用专家演示来正则化由行为克隆学到的策略。我们的发现揭示,使用 个专家演示可在有限情形下以 的样本复杂度、在线性马尔可夫决策过程中以 的样本复杂度辨识最优策略,其中 为目标精度, 为 horizon, 为动作数,有限情形下 为状态数,线性情形下 为特征空间维数。作为副产品,我们在策略类的一般假设下为行为克隆过程提供了紧收敛保证。此外,我们确立演示正则化方法对于基于人类反馈的强化学习(RLHF)是可达效率的。就此,我们提供理论证据显示 KL 正则化在表格与线性 MDP 中对 RLHF 的益处。有趣的是,我们通过采用计算可行的正则化来处理奖励估计不确定性,从而避免悲观注入,由此使我们的方法与先前工作区分开来。
引用
@article{arxiv.2310.17303,
title = {Demonstration-Regularized RL},
author = {Daniil Tiapkin and Denis Belomestny and Daniele Calandriello and Eric Moulines and Alexey Naumov and Pierre Perrault and Michal Valko and Pierre Menard},
journal= {arXiv preprint arXiv:2310.17303},
year = {2024}
}
备注
This revision fixes an error due to use of some incorrect results (Lemma 32, Corollary 11 by Talebi & Maillard, 2018) in the proof of Theorem 8. The condition for the RLHF results have slightly changed