中文

求解逆非合作线性二次输出反馈微分博弈的强化学习方法

最优化与控制 2024-10-27 v1 动力系统

摘要

在本文中,我们研究具有输出反馈的线性二次微分非合作博弈的逆问题。给定玩家的镇定反馈律,目标是寻找代价函数参数,使得观测到的博弈动态在该博弈中处于 Nash 均衡。利用给定的反馈律,我们提出一种基于模型的算法,生成求解上述逆问题的代价函数参数。我们引入一种校正程序,在算法的每次迭代中保证反馈律的存在性,这解决了输出反馈控制设计的一个关键挑战。作为算法的中间阶段,我们开发了一种在输出反馈信息结构下对多输入系统进行初始镇定的程序。我们证明了算法的收敛性和稳定性,并展示了无需重复运行完整算法即可生成具有必要属性的新博弈的方法。随后,该算法被扩展为无模型版本,其使用由未知动态生成的数据样本,并具有与基于模型版本相同的收敛和镇定特性。最后,我们展示了如何以分布式方式求解该逆问题,并提供了可能的扩展。仿真结果验证了所提算法的有效性。

关键词

引用

@article{arxiv.2403.02146,
  title  = {Reinforcement Learning for Inverse Non-Cooperative Linear-Quadratic Output-feedback Differential Games},
  author = {Emin Martirosyan and Ming Cao},
  journal= {arXiv preprint arXiv:2403.02146},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication