带状态约束的一般和微分博弈的参数化值近似
机器人学
2025-03-11 v1
摘要
一般和微分博弈可以近似通过 Hamilton-Jacobi-Isaacs (HJI) 方程求解的值,从而在信息不完整时实现高效推理。然而,通过传统方法求解此类博弈会遇到维数灾难。物理信息神经网络提供了一种可扩展的方法来缓解 CoD 并近似值,但当状态约束导致值具有较大的 Lipschitz 常数时,特别是在安全关键型应用中,通过原始 PINNs 进行值近似会存在收敛问题。除了解决 CoD 之外,还需要在博弈的参数空间中学习可泛化的值,而不是为每个特定的玩家类型配置训练多个模型。为了克服这些挑战,我们提出了一种混合神经算子,这是一种可以将博弈的参数函数映射到值函数的算子。HNO 利用信息丰富的监督数据,并在整个时空空间中采样 PDE 驱动的数据以进行模型优化。我们在具有非线性动力学和状态约束的 9D 和 13D 场景下评估了 HNO,并将其与监督神经算子(DeepONet 的一种变体)进行了比较。在相同的计算预算和训练数据下,HNO 在安全性能方面优于 SNO。这项工作朝着可扩展和可泛化的值函数近似迈出了一步,实现了复杂人机或多智能体交互的实时推理。
引用
@article{arxiv.2503.06994,
title = {Parametric Value Approximation for General-sum Differential Games with State Constraints},
author = {Lei Zhang and Mukesh Ghimire and Wenlong Zhang and Zhe Xu and Yi Ren},
journal= {arXiv preprint arXiv:2503.06994},
year = {2025}
}
备注
Submitted to IROS 2025