基于逐次凸逼近的离屏优化用于约束强化学习
机器学习
2022-04-20 v1
摘要
我们提出一种基于逐次凸逼近的离屏优化(SCAOPO)算法来求解一般约束强化学习问题,该问题在平均代价背景下被表述为约束马尔可夫决策过程(CMDP)。SCAOPO 基于求解一系列凸目标/可行性优化问题,这些问题的原问题中的目标与约束函数被凸代理函数替换而得到。在每次迭代中,即使策略由高维函数参数化,凸代理问题也可通过拉格朗日对偶方法高效求解。此外,SCAOPO 能够复用先前更新的旧经验,从而显著降低部署于需在线学习环境的实际工程系统中的实现成本。尽管存在时变状态分布与离屏学习引起的随机偏差,具有可行初值的 SCAOPO 仍可被证明以概率 1 收敛至原问题的 Karush-Kuhn-Tucker (KKT) 点。
引用
@article{arxiv.2105.12545,
title = {Successive Convex Approximation Based Off-Policy Optimization for Constrained Reinforcement Learning},
author = {Chang Tian and An Liu and Guang Huang and Wu Luo},
journal= {arXiv preprint arXiv:2105.12545},
year = {2022}
}
备注
submitted to Transactions on Signal Processing