中文

带状态约束的双人一般和微分博弈的值逼近

机器人学 2024-05-08 v3 计算机科学与博弈论 机器学习

摘要

数值求解 Hamilton-Jacobi-Isaacs(HJI)偏微分方程可在双人微分博弈中实现平衡反馈控制,但面临维度灾难(CoD)。尽管物理信息神经网络(PINNs)在缓解求解偏微分方程中的 CoD 方面已显示出前景,但原始 PINNs 因其采样特性难以学习不连续解,当由于状态或时序逻辑约束导致值不连续时,所得策略的安全性能较差。在本研究中,我们探索了应对该挑战的三种潜在方案:(1)一种由监督均衡与 HJI 偏微分方程共同引导的混合学习方法;(2)一种值硬化方法,其中求解一系列具有递增约束违反惩罚 Lipschitz 常数的 HJI;(3)将值提升到更高维状态空间从而变得连续的图上技术。通过 5 维与 9 维车辆以及 13 维无人机仿真评估表明,混合方法借助监督均衡值与协态以及 PINN 损失梯度的低成本,在泛化与安全性能上优于其他方法。

关键词

引用

@article{arxiv.2311.16520,
  title  = {Value Approximation for Two-Player General-Sum Differential Games with State Constraints},
  author = {Lei Zhang and Mukesh Ghimire and Wenlong Zhang and Zhe Xu and Yi Ren},
  journal= {arXiv preprint arXiv:2311.16520},
  year   = {2024}
}

备注

Published to T-RO as preprint