中文

用于强化学习的高效Wasserstein自然梯度

机器学习 2021-03-19 v4

摘要

提出一种新颖的优化方法,应用于强化学习(RL)的策略梯度方法与进化策略。该过程使用计算高效的Wasserstein自然梯度(WNG)下降,其利用由Wasserstein惩罚诱导的几何来加速优化。此方法遵循RL中近期在目标中引入散度惩罚以建立信赖域的主题。在挑战性任务上的实验表明,相较先进基线,在计算成本与性能上均有改进。

关键词

引用

@article{arxiv.2010.05380,
  title  = {Efficient Wasserstein Natural Gradients for Reinforcement Learning},
  author = {Ted Moskovitz and Michael Arbel and Ferenc Huszar and Arthur Gretton},
  journal= {arXiv preprint arXiv:2010.05380},
  year   = {2021}
}