基于Fisher散度评论家正则化的离线强化学习
机器学习
2021-03-16 v1
摘要
许多现代离线强化学习(RL)方法利用行为正则化,通常将无模型演员-评论家算法与一个衡量策略偏离离线数据程度的惩罚项相结合。在本工作中,我们提出一种替代方案来促使所学策略贴近数据,即将评论家参数化为生成离线数据的对数行为策略加上一个状态-动作价值偏移项,该偏移项可用神经网络学习。行为正则化于是对应于对该偏移项的适当正则化。我们提出对偏移项使用梯度惩罚正则化,并证明其等价于Fisher散度正则化,这表明了其与得分匹配及生成式基于能量的模型文献之间的联系。因此我们称所得算法为Fisher-BRC(行为正则化评论家,Behavior Regularized Critic)。在标准离线RL基准上,Fisher-BRC相比现有最先进方法取得了更优性能和更快收敛。
引用
@article{arxiv.2103.08050,
title = {Offline Reinforcement Learning with Fisher Divergence Critic Regularization},
author = {Ilya Kostrikov and Jonathan Tompson and Rob Fergus and Ofir Nachum},
journal= {arXiv preprint arXiv:2103.08050},
year = {2021}
}