IPO:约束下的内点策略优化
机器学习
2019-10-23 v1 最优化与控制
机器学习
摘要
本文中,我们研究强化学习(RL)算法以解决现实世界决策问题,其目标为最大化长期奖励并满足累积约束。我们提出一种新颖的一阶策略优化方法——内点策略优化(IPO),其受内点法启发,以对数障碍函数增广目标函数。我们提出的方法易于实现且具有性能保证,可处理一般类型的累积多约束设定。我们进行了广泛评估,将我们的方法与最先进的基线进行比较。我们的算法在奖励最大化与约束满足方面均优于基线算法。
引用
@article{arxiv.1910.09615,
title = {IPO: Interior-point Policy Optimization under Constraints},
author = {Yongshuai Liu and Jiaxin Ding and Xin Liu},
journal= {arXiv preprint arXiv:1910.09615},
year = {2019}
}