基于激励反馈 Stackelberg 博弈与 Q-learning 的无模型弹性控制器设计
系统与控制
2024-03-15 v1 计算机科学与博弈论
系统与控制
摘要
在智能环境中信息物理系统(CPSs)的快速发展中,尤其是在由工业4.0塑造的工业领域,发展的激增带来了前所未有的安全挑战。本文探讨了工业信息物理系统(ICPSs)的复杂安全问题,特别关注由能够直接破坏控制器的智能攻击者所带来的独特威胁,从而对物理安全构成直接风险。在分层控制和激励反馈 Stackelberg 博弈的框架内,我们设计了一种能够自适应受损跟随控制器(follower)的弹性主导控制器(leader),使得受损的跟随者与主导者合作,将其策略与主导者的目标对齐以实现团队最优解。首先,我们给出了在系统动力学已知时激励 Stackelberg 解存在的充分条件。然后,我们提出了一种基于 Q-learning 的近似动态规划(ADP)方法,以及相应的在线求解激励 Stackelberg 解的算法,且无需系统动力学的先验知识。最后,我们证明了该方法向最优解的收敛性。
引用
@article{arxiv.2403.08948,
title = {Model-free Resilient Controller Design based on Incentive Feedback Stackelberg Game and Q-learning},
author = {Jiajun Shen and Fengjun Li and Morteza Hashemi and Huazhen Fang},
journal= {arXiv preprint arXiv:2403.08948},
year = {2024}
}
备注
8 pages