带状态约束的双人一般和微分博弈的值逼近
机器人学
2024-05-08 v3 计算机科学与博弈论
机器学习
摘要
数值求解 Hamilton-Jacobi-Isaacs(HJI)偏微分方程可在双人微分博弈中实现平衡反馈控制,但面临维度灾难(CoD)。尽管物理信息神经网络(PINNs)在缓解求解偏微分方程中的 CoD 方面已显示出前景,但原始 PINNs 因其采样特性难以学习不连续解,当由于状态或时序逻辑约束导致值不连续时,所得策略的安全性能较差。在本研究中,我们探索了应对该挑战的三种潜在方案:(1)一种由监督均衡与 HJI 偏微分方程共同引导的混合学习方法;(2)一种值硬化方法,其中求解一系列具有递增约束违反惩罚 Lipschitz 常数的 HJI;(3)将值提升到更高维状态空间从而变得连续的图上技术。通过 5 维与 9 维车辆以及 13 维无人机仿真评估表明,混合方法借助监督均衡值与协态以及 PINN 损失梯度的低成本,在泛化与安全性能上优于其他方法。
引用
@article{arxiv.2311.16520,
title = {Value Approximation for Two-Player General-Sum Differential Games with State Constraints},
author = {Lei Zhang and Mukesh Ghimire and Wenlong Zhang and Zhe Xu and Yi Ren},
journal= {arXiv preprint arXiv:2311.16520},
year = {2024}
}
备注
Published to T-RO as preprint