学习为行为评分以引导策略优化
机器学习
2020-03-05 v4 机器学习
摘要
我们引入一种比较强化学习策略的新方法,该方法在新定义的潜在行为空间中使用 Wasserstein 距离(WD)。我们证明,通过利用 WD 的对偶形式,我们可以学习策略行为上的评分函数,这些函数进而可用于引导策略优化朝向(或远离)(不)期望的行为。结合平滑 WD,对偶形式使我们能够设计出通过 WD 正则化项进行随机梯度下降步的高效算法。我们将这些正则化项整合到两种新颖的在策略算法中,即行为引导策略梯度和行为引导进化策略,并证明它们在多种具有挑战性的环境中能够优于现有方法。我们还提供了一个开源演示。
引用
@article{arxiv.1906.04349,
title = {Learning to Score Behaviors for Guided Policy Optimization},
author = {Aldo Pacchiano and Jack Parker-Holder and Yunhao Tang and Anna Choromanska and Krzysztof Choromanski and Michael I. Jordan},
journal= {arXiv preprint arXiv:1906.04349},
year = {2020}
}