一种用于约束强化学习且具有可证明收敛性的单循环深度Actor-Critic算法
机器学习
2024-09-19 v2
摘要
深度Actor-Critic算法将Actor-Critic与深度神经网络(DNN)结合,已成为模拟环境中决策问题最普遍的强化学习算法之一。然而,现有深度Actor-Critic算法尚不成熟,难以解决具有非凸随机约束且与环境交互代价高的现实问题。本文中,我们提出一种用于一般约束强化学习(CRL)问题的单循环深度Actor-Critic(SLDAC)算法框架。在actor步中,应用约束随机逐次凸逼近(CSSCA)方法处理非凸随机目标与约束。在critic步中,critic DNN每次迭代仅更新一次或有限几次,将算法简化为单循环框架(现有工作需对critic步进行足够次数的更新以确保每次迭代内循环的良好收敛)。此外,通过复用旧策略的观测降低了策略梯度估计的方差。单循环设计与观测复用有效降低了智能体-环境交互代价与计算复杂度。尽管单循环设计与观测复用带来了有偏的策略梯度估计,我们证明具有可行初始点的SLDAC几乎必然收敛到原问题的Karush-Kuhn-Tuker(KKT)点。仿真表明,SLDAC算法能以低得多的交互代价取得优越性能。
引用
@article{arxiv.2306.06402,
title = {A Single-Loop Deep Actor-Critic Algorithm for Constrained Reinforcement Learning with Provable Convergence},
author = {Kexuan Wang and An Liu and Baishuo Lin},
journal= {arXiv preprint arXiv:2306.06402},
year = {2024}
}