基于深度强化学习的概率布尔控制网络最优无限时域控制
系统与控制
2023-04-10 v1 系统与控制
摘要
本文提出一种基于深度强化学习的方法,用于获取概率布尔控制网络(PBCNs)最优无限时域控制的最优策略。与现有文献相比,所提方法为无模型的,即无需已知系统模型与初始状态。同时,该方法适用于大规模 PBCNs。首先,我们建立深度强化学习与最优无限时域控制之间的联系,并将该问题构建为马尔可夫决策过程框架。然后,根据动作值记忆是否超出计算机 RAM,将 PBCNs 定义为小规模或大规模。基于新引入的定义,分别将 Q-learning(QL)与双深度 Q 网络(DDQN)应用于小规模与大规模 PBCNs 的最优无限时域控制。同时,设计了最优状态反馈控制器。最后,给出两个示例,分别为含 3 个节点的小规模 PBCN 与含 28 个节点的大规模 PBCN。为验证 QL 与 DDQN 的收敛性,将两种算法所得最优控制策略与最优动作值同基于名为策略迭代的有模型方法所得结果进行比较。同时,在小型 PBCN 中将 QL 与 DDQN 的性能进行比较。
引用
@article{arxiv.2304.03489,
title = {Deep Reinforcement Learning Based Optimal Infinite-Horizon Control of Probabilistic Boolean Control Networks},
author = {Jingjie Ni and Fangfei Li and Zheng-Guang Wu},
journal= {arXiv preprint arXiv:2304.03489},
year = {2023}
}