通过度量感知信赖域方法实现可证明收敛的策略优化
机器学习
2023-06-27 v1 人工智能
最优化与控制
摘要
基于 Kullback-Leibler 散度的信赖域方法被广泛用于稳定强化学习中的策略优化。本文利用更灵活的度量,考察了带有 Wasserstein 和 Sinkhorn 信赖域的策略优化的两种自然扩展,即 Wasserstein 策略优化(WPO)和 Sinkhorn 策略优化(SPO)。我们不直接将策略限制于参数化分布类,而是直接优化策略分布,并基于拉格朗日对偶推导其闭式策略更新。理论上,我们证明 WPO 保证单调性能提升,且 SPO 在熵正则化项衰减时可证明收敛到 WPO。此外,我们证明在信赖域约束上使用衰减的拉格朗日乘子时,两种方法均收敛到全局最优。在表格域、机器人运动与连续控制任务上的实验进一步证明了这两种方法相较最先进策略梯度方法的性能提升、WPO 对样本不足的更强鲁棒性,以及 SPO 的更快收敛。
引用
@article{arxiv.2306.14133,
title = {Provably Convergent Policy Optimization via Metric-aware Trust Region Methods},
author = {Jun Song and Niao He and Lijun Ding and Chaoyue Zhao},
journal= {arXiv preprint arXiv:2306.14133},
year = {2023}
}