监视-规避博弈中的可见性优化
人工智能
2022-03-29 v2 最优化与控制
摘要
我们考虑监视-规避微分博弈,其中追踪者必须试图持续保持对移动逃避者的可见性。一旦逃避者被遮挡,追踪者即告失败。该博弈的最优控制可表述为 Hamilton-Jacobi-Isaac 方程。我们使用迎风格式来计算对应于该微分博弈终局时间的反馈值函数。尽管值函数能够实现最优控制,但即便在小型网格上仅有一个追踪者和一个逃避者,其计算代价也高得令人望而却步。我们考虑该监视博弈的离散变体。基于针对多追踪者与多逃避者的监视-规避博弈的静态值函数,我们提出了两种局部最优策略。我们展示了蒙特卡洛树搜索与自我博弈强化学习能够训练深度神经网络,以生成用于在线博弈的合理策略。在充足的计算资源与离线训练时间下,所提模型能够持续改进其策略并高效扩展至更高分辨率。
引用
@article{arxiv.2010.09001,
title = {Visibility Optimization for Surveillance-Evasion Games},
author = {Louis Ly and Yen-Hsi Richard Tsai},
journal= {arXiv preprint arXiv:2010.09001},
year = {2022}
}