中文

学习为行为评分以引导策略优化

机器学习 2020-03-05 v4 机器学习

摘要

我们引入一种比较强化学习策略的新方法,该方法在新定义的潜在行为空间中使用 Wasserstein 距离(WD)。我们证明,通过利用 WD 的对偶形式,我们可以学习策略行为上的评分函数,这些函数进而可用于引导策略优化朝向(或远离)(不)期望的行为。结合平滑 WD,对偶形式使我们能够设计出通过 WD 正则化项进行随机梯度下降步的高效算法。我们将这些正则化项整合到两种新颖的在策略算法中,即行为引导策略梯度和行为引导进化策略,并证明它们在多种具有挑战性的环境中能够优于现有方法。我们还提供了一个开源演示。

关键词

引用

@article{arxiv.1906.04349,
  title  = {Learning to Score Behaviors for Guided Policy Optimization},
  author = {Aldo Pacchiano and Jack Parker-Holder and Yunhao Tang and Anna Choromanska and Krzysztof Choromanski and Michael I. Jordan},
  journal= {arXiv preprint arXiv:1906.04349},
  year   = {2020}
}