用于强化学习的高效Wasserstein自然梯度
机器学习
2021-03-19 v4
摘要
提出一种新颖的优化方法,应用于强化学习(RL)的策略梯度方法与进化策略。该过程使用计算高效的Wasserstein自然梯度(WNG)下降,其利用由Wasserstein惩罚诱导的几何来加速优化。此方法遵循RL中近期在目标中引入散度惩罚以建立信赖域的主题。在挑战性任务上的实验表明,相较先进基线,在计算成本与性能上均有改进。
引用
@article{arxiv.2010.05380,
title = {Efficient Wasserstein Natural Gradients for Reinforcement Learning},
author = {Ted Moskovitz and Michael Arbel and Ferenc Huszar and Arthur Gretton},
journal= {arXiv preprint arXiv:2010.05380},
year = {2021}
}