双人一般和微分博弈中不连续纳什均衡值的逼近
机器学习
2023-02-28 v3 计算机科学与博弈论
机器人学
摘要
寻找双人微分博弈的纳什均衡策略需要求解 Hamilton-Jacobi-Isaacs (HJI) 偏微分方程。自监督学习已被用于逼近此类偏微分方程的解,同时规避维数灾难。然而,由于其采样特性,该方法无法学习不连续的偏微分方程解,导致在玩家奖励不连续时,所得控制器在机器人应用中的安全性表现较差。本文研究该问题的两种潜在解决方案:一种利用监督纳什均衡与 HJI 偏微分方程相结合的混合方法,以及一种逐步硬化奖励并求解一系列 HJI 的值硬化方法。我们在分别具有 5 维和 9 维状态空间的两个车辆交互仿真研究中,通过比较所得泛化与安全性表现来评估这些方案。结果表明,在信息丰富的监督(例如碰撞与近碰撞演示)以及自监督学习的低代价下,混合方法在同等计算预算下比监督、自监督和值硬化方法取得更好的安全性表现。若无信息丰富的监督,值硬化在高维情形下无法泛化。最后,我们表明神经激活函数需为连续可微以用于学习偏微分方程,且其选择可能依具体情况而定。
引用
@article{arxiv.2207.01773,
title = {Approximating Discontinuous Nash Equilibrial Values of Two-Player General-Sum Differential Games},
author = {Lei Zhang and Mukesh Ghimire and Wenlong Zhang and Zhe Xu and Yi Ren},
journal= {arXiv preprint arXiv:2207.01773},
year = {2023}
}
备注
Accepted by ICRA 2023