AlgaeDICE:从任意经验中进行策略梯度学习
机器学习
2019-12-05 v1 人工智能
摘要
在强化学习(RL)的许多实际应用中,由于成本或可行性限制,与环境的互动十分有限。这对传统 RL 算法提出了挑战,因为最大回报目标涉及对同策略(on-policy)样本的期望。我们引入了一种新的最大回报优化表述,使得该问题可以通过对任意与行为无关且异策略(off-policy)的数据分布的期望来重新表达。我们首先通过考虑正则化版本的双重最大回报目标推导出这一结果,随后利用 Q 值线性规划表征的拉格朗日表述将发现推广至非正则化目标。我们证明,若优化该目标的辅助对偶变量,则异策略目标的梯度恰好是同策略策略梯度,而无需使用任何重要性加权。除了揭示该方法引人注目的理论性质外,我们还展示了其良好的实际性能。
引用
@article{arxiv.1912.02074,
title = {AlgaeDICE: Policy Gradient from Arbitrary Experience},
author = {Ofir Nachum and Bo Dai and Ilya Kostrikov and Yinlam Chow and Lihong Li and Dale Schuurmans},
journal= {arXiv preprint arXiv:1912.02074},
year = {2019}
}