基于软行为正则化的离线强化学习
机器学习
2021-10-15 v1
摘要
大多数先前的离线强化学习方法都利用行为正则化,通常是在现有的异策略演员-评论家算法中增加一个衡量策略与离线数据之间差异的惩罚项。然而,这些方法缺乏相对于行为策略的性能提升保证。在这项工作中,我们从学习策略与行为策略之间的性能差异出发,推导出一个可用于离线设置的新策略学习目标,该目标对应于行为策略的优势函数值乘以状态-边缘密度比。我们提出了一种计算密度比的实用方法,并证明了其等价于一种状态依赖的行为正则化。与先前方法中使用的状态无关正则化不同,这种软正则化允许策略在高置信度状态下有更大的偏离自由度,从而带来更好的性能和稳定性。因此,我们将所得算法称为软行为正则化演员-评论家(SBAC)。我们的实验结果表明,在一系列连续控制运动和操作任务上,SBAC 的性能与最先进方法相当或更优。
引用
@article{arxiv.2110.07395,
title = {Offline Reinforcement Learning with Soft Behavior Regularization},
author = {Haoran Xu and Xianyuan Zhan and Jianxiong Li and Honglei Yin},
journal= {arXiv preprint arXiv:2110.07395},
year = {2021}
}