中文

演示正则化强化学习

机器学习 2024-06-11 v2 机器学习

摘要

引入专家演示已在经验上有助于提升强化学习(RL)的样本效率。本文从理论上量化了这一额外信息在多大程度上降低了 RL 的样本复杂度。具体而言,我们研究演示正则化强化学习,其通过 KL 正则化利用专家演示来正则化由行为克隆学到的策略。我们的发现揭示,使用 NEN^{\mathrm{E}} 个专家演示可在有限情形下以 O~(Poly(S,A,H)/(ε2NE))\widetilde{O}(\mathrm{Poly}(S,A,H)/(\varepsilon^2 N^{\mathrm{E}})) 的样本复杂度、在线性马尔可夫决策过程中以 O~(Poly(d,H)/(ε2NE))\widetilde{O}(\mathrm{Poly}(d,H)/(\varepsilon^2 N^{\mathrm{E}})) 的样本复杂度辨识最优策略,其中 ε\varepsilon 为目标精度,HH 为 horizon,AA 为动作数,有限情形下 SS 为状态数,线性情形下 dd 为特征空间维数。作为副产品,我们在策略类的一般假设下为行为克隆过程提供了紧收敛保证。此外,我们确立演示正则化方法对于基于人类反馈的强化学习(RLHF)是可达效率的。就此,我们提供理论证据显示 KL 正则化在表格与线性 MDP 中对 RLHF 的益处。有趣的是,我们通过采用计算可行的正则化来处理奖励估计不确定性,从而避免悲观注入,由此使我们的方法与先前工作区分开来。

关键词

引用

@article{arxiv.2310.17303,
  title  = {Demonstration-Regularized RL},
  author = {Daniil Tiapkin and Denis Belomestny and Daniele Calandriello and Eric Moulines and Alexey Naumov and Pierre Perrault and Michal Valko and Pierre Menard},
  journal= {arXiv preprint arXiv:2310.17303},
  year   = {2024}
}

备注

This revision fixes an error due to use of some incorrect results (Lemma 32, Corollary 11 by Talebi & Maillard, 2018) in the proof of Theorem 8. The condition for the RLHF results have slightly changed