基于非平衡最优传输的分布约束策略优化
机器学习
2021-02-17 v1
摘要
我们考虑强化学习中的约束策略优化,其中约束以状态访问和全局动作执行的边际分布形式给出。给定这些分布,我们将策略优化表述为占据测度空间上的非平衡最优传输。我们提出一个基于 Bregman 散度的通用强化学习目标,并使用 Dykstra 算法进行优化。当状态或动作空间较大且仅有边际分布的样本可用时,该方法可导出一种 actor-critic 算法。我们讨论了该方法的应用,并通过演示展示我们算法的有效性。
引用
@article{arxiv.2102.07889,
title = {Distributionally-Constrained Policy Optimization via Unbalanced Optimal Transport},
author = {Arash Givchi and Pei Wang and Junqi Wang and Patrick Shafto},
journal= {arXiv preprint arXiv:2102.07889},
year = {2021}
}