半无限约束马尔可夫决策过程与高效强化学习
机器学习
2023-05-02 v1 机器学习
摘要
我们提出一种受约束马尔可夫决策过程(CMDP)的新推广,称之为半无限约束马尔可夫决策过程(SICMDP)。特别地,我们考虑约束的连续统,而非普通CMDP中的有限个约束。我们还设计了两种用于SICMDP的强化学习算法,称为SI-CRL和SI-CPO。SI-CRL是一种基于模型的强化学习算法。在给定转移模型估计后,我们首先将强化学习问题转化为线性半无限规划(LSIP)问题,然后利用LSIP文献中的对偶交换方法求解。SI-CPO是一种策略优化算法。借鉴合作随机逼近方法的思路,我们对策略参数进行交替更新以最大化奖励或最小化代价。据我们所知,我们首次将半无限规划(SIP)的工具应用于求解约束强化学习问题。我们对SI-CRL和SI-CPO进行了理论分析,确定了它们的迭代复杂度和样本复杂度。我们还进行了大量数值实验以说明SICMDP模型,并证明所提算法能够利用现代深度强化学习技术求解复杂序列决策任务。
引用
@article{arxiv.2305.00254,
title = {Semi-Infinitely Constrained Markov Decision Processes and Efficient Reinforcement Learning},
author = {Liangyu Zhang and Yang Peng and Wenhao Yang and Zhihua Zhang},
journal= {arXiv preprint arXiv:2305.00254},
year = {2023}
}
备注
Shorter version accepted at NeurIPS 2022