中文

IPO:约束下的内点策略优化

机器学习 2019-10-23 v1 最优化与控制 机器学习

摘要

本文中,我们研究强化学习(RL)算法以解决现实世界决策问题,其目标为最大化长期奖励并满足累积约束。我们提出一种新颖的一阶策略优化方法——内点策略优化(IPO),其受内点法启发,以对数障碍函数增广目标函数。我们提出的方法易于实现且具有性能保证,可处理一般类型的累积多约束设定。我们进行了广泛评估,将我们的方法与最先进的基线进行比较。我们的算法在奖励最大化与约束满足方面均优于基线算法。

关键词

引用

@article{arxiv.1910.09615,
  title  = {IPO: Interior-point Policy Optimization under Constraints},
  author = {Yongshuai Liu and Jiaxin Ding and Xin Liu},
  journal= {arXiv preprint arXiv:1910.09615},
  year   = {2019}
}