中文

Wasserstein 策略优化

机器学习 2025-05-02 v1 人工智能

摘要

我们提出了 Wasserstein 策略优化(WPO),一种用于连续动作空间强化学习的 Actor-Critic 算法。WPO 可推导为对所有策略空间上的 Wasserstein 梯度流投影到有限维参数空间(例如神经网络的权重)的近似,从而产生一种简单且完全通用的闭式更新。所得算法结合了确定性策略梯度方法与经典策略梯度方法的诸多特性。如同确定性策略梯度,它利用了动作价值函数关于动作的梯度知识。如同经典策略梯度,它可应用于具有任意动作分布的随机策略——而无需使用重参数化技巧。我们在 DeepMind Control Suite 和磁约束聚变任务上展示了结果,其表现优于当前最先进的连续控制方法。

关键词

引用

@article{arxiv.2505.00663,
  title  = {Wasserstein Policy Optimization},
  author = {David Pfau and Ian Davies and Diana Borsa and Joao G. M. Araujo and Brendan Tracey and Hado van Hasselt},
  journal= {arXiv preprint arXiv:2505.00663},
  year   = {2025}
}

备注

Accepted to ICML 2025