中文

基于Fisher散度评论家正则化的离线强化学习

机器学习 2021-03-16 v1

摘要

许多现代离线强化学习(RL)方法利用行为正则化,通常将无模型演员-评论家算法与一个衡量策略偏离离线数据程度的惩罚项相结合。在本工作中,我们提出一种替代方案来促使所学策略贴近数据,即将评论家参数化为生成离线数据的对数行为策略加上一个状态-动作价值偏移项,该偏移项可用神经网络学习。行为正则化于是对应于对该偏移项的适当正则化。我们提出对偏移项使用梯度惩罚正则化,并证明其等价于Fisher散度正则化,这表明了其与得分匹配及生成式基于能量的模型文献之间的联系。因此我们称所得算法为Fisher-BRC(行为正则化评论家,Behavior Regularized Critic)。在标准离线RL基准上,Fisher-BRC相比现有最先进方法取得了更优性能和更快收敛。

关键词

引用

@article{arxiv.2103.08050,
  title  = {Offline Reinforcement Learning with Fisher Divergence Critic Regularization},
  author = {Ilya Kostrikov and Jonathan Tompson and Rob Fergus and Ofir Nachum},
  journal= {arXiv preprint arXiv:2103.08050},
  year   = {2021}
}