中文

基于非平衡最优传输的分布约束策略优化

机器学习 2021-02-17 v1

摘要

我们考虑强化学习中的约束策略优化,其中约束以状态访问和全局动作执行的边际分布形式给出。给定这些分布,我们将策略优化表述为占据测度空间上的非平衡最优传输。我们提出一个基于 Bregman 散度的通用强化学习目标,并使用 Dykstra 算法进行优化。当状态或动作空间较大且仅有边际分布的样本可用时,该方法可导出一种 actor-critic 算法。我们讨论了该方法的应用,并通过演示展示我们算法的有效性。

关键词

引用

@article{arxiv.2102.07889,
  title  = {Distributionally-Constrained Policy Optimization via Unbalanced Optimal Transport},
  author = {Arash Givchi and Pei Wang and Junqi Wang and Patrick Shafto},
  journal= {arXiv preprint arXiv:2102.07889},
  year   = {2021}
}