面向随机策略的无信赖域策略优化
机器学习
2023-02-17 v1 人工智能
摘要
信赖域策略优化(TRPO)是一种迭代方法,它在每次迭代中同时最大化替代目标并对连续策略施加信赖域约束。替代目标最大化与信赖域约束的结合已被证明对保证策略的单调改进至关重要。然而,求解信赖域约束优化问题计算开销大,因为它需要多步共轭梯度以及大量同策略样本。在本文中,我们表明可以在不损害底层单调改进保证的前提下,用无信赖域约束安全地替代策略上的信赖域约束。关键思想是对 TRPO 中使用的替代目标进行推广,使得约束策略间最大优势加权比仍会带来单调改进保证。这一新约束为迭代策略优化勾勒出一种保守机制,并为优化广义替代目标提供了实用思路。我们表明,在实践中优化广义目标函数时采取保守方式即可有效实施该新约束。我们将所得算法称为无信赖域策略优化(TREFree),因为它不含任何显式信赖域约束。实验结果表明,TREFree 在策略性能和样本效率方面优于 TRPO 和近端策略优化(PPO)。
引用
@article{arxiv.2302.07985,
title = {Trust-Region-Free Policy Optimization for Stochastic Policies},
author = {Mingfei Sun and Benjamin Ellis and Anuj Mahajan and Sam Devlin and Katja Hofmann and Shimon Whiteson},
journal= {arXiv preprint arXiv:2302.07985},
year = {2023}
}
备注
RLDM 2022