通过约束状态分布偏移的离策略策略梯度算法
机器学习
2019-12-03 v2 人工智能
机器学习
摘要
由于被称为外推误差(extrapolation error)的现象,离策略深度强化学习(RL)算法无法仅从批量离线数据而不与环境进行在线交互来学习。这通常是由于重放缓冲区中可用的过去数据可能与当前策略下的数据分布差异很大。我们认为,大多数离策略学习方法从根本上遭受由于行为策略与目标策略所采集状态访问分布不匹配导致的状态分布偏移(state distribution shift)。当前与过去样本之间的数据分布偏移会显著影响大多数现代基于离策略的策略优化算法的性能。本工作中,我们首先对离策略学习中的状态分布失配进行系统分析,然后提出一种新颖的离策略策略优化方法来约束状态分布偏移。为此,我们首先基于状态特征使用密度估计器估计状态分布,进而提出一种最小化状态分布偏移的受约束离策略梯度目标。我们在连续控制任务上的实验结果表明,最小化该分布失配可显著改善大多数流行实用离策略策略梯度算法的性能。
引用
@article{arxiv.1911.06970,
title = {Off-Policy Policy Gradient Algorithms by Constraining the State Distribution Shift},
author = {Riashat Islam and Komal K. Teru and Deepak Sharma and Joelle Pineau},
journal= {arXiv preprint arXiv:1911.06970},
year = {2019}
}
备注
Accepted at NeurIPS 2019 workshop on Deep Reinforcement Learning