重访随机异策略动作值梯度
机器学习
2017-03-14 v2 机器学习
摘要
异策略随机 Actor-Critic 方法依赖于逼近随机策略梯度以推导出最优策略。也可以通过逼近动作值梯度来推导最优策略。使用动作值梯度是可取的,因为策略改进沿着最陡上升的方向进行。这已在自然梯度 Actor-Critic 算法的背景下得到广泛研究,并且最近在确定性策略梯度的背景下也得到研究。在本文中,我们简要讨论了确定性动作值梯度的异策略随机对应方法,以及一种用于遵循策略梯度而非自然梯度的增量方法。
引用
@article{arxiv.1703.02102,
title = {Revisiting stochastic off-policy action-value gradients},
author = {Yemi Okesanjo and Victor Kofia},
journal= {arXiv preprint arXiv:1703.02102},
year = {2017}
}