中文

基于激励反馈 Stackelberg 博弈与 Q-learning 的无模型弹性控制器设计

系统与控制 2024-03-15 v1 计算机科学与博弈论 系统与控制

摘要

在智能环境中信息物理系统(CPSs)的快速发展中,尤其是在由工业4.0塑造的工业领域,发展的激增带来了前所未有的安全挑战。本文探讨了工业信息物理系统(ICPSs)的复杂安全问题,特别关注由能够直接破坏控制器的智能攻击者所带来的独特威胁,从而对物理安全构成直接风险。在分层控制和激励反馈 Stackelberg 博弈的框架内,我们设计了一种能够自适应受损跟随控制器(follower)的弹性主导控制器(leader),使得受损的跟随者与主导者合作,将其策略与主导者的目标对齐以实现团队最优解。首先,我们给出了在系统动力学已知时激励 Stackelberg 解存在的充分条件。然后,我们提出了一种基于 Q-learning 的近似动态规划(ADP)方法,以及相应的在线求解激励 Stackelberg 解的算法,且无需系统动力学的先验知识。最后,我们证明了该方法向最优解的收敛性。

关键词

引用

@article{arxiv.2403.08948,
  title  = {Model-free Resilient Controller Design based on Incentive Feedback Stackelberg Game and Q-learning},
  author = {Jiajun Shen and Fengjun Li and Morteza Hashemi and Huazhen Fang},
  journal= {arXiv preprint arXiv:2403.08948},
  year   = {2024}
}

备注

8 pages