中文

基于博弈论的强化学习边境防御:基于解析解的早期终止

机器学习 2026-03-18 v1 系统与控制 系统与控制

摘要

博弈论为分析对抗性交战提供金标准,能提供强大的最优性保证。然而,当假设如完美信息被违反时,这些保证常常 brittle。相比之下,强化学习(RL)具有适应性,但在大型复杂领域中可能存在样本效率低下的问题。本文引入一种混合方法,利用博弈论见解来提高RL训练效率。我们研究一种有限感知范围的边境防御游戏,其中防御者性能取决于搜索和追逐策略,使得经典微分博弈解无法适用。我们采用阿波罗圆(Apollonius Circle, AC)来计算检测阶段的均衡,从而实现RL剧情的早期终止,而无需学习追逐动力学。这使得RL能够集中学习搜索策略,同时在检测后保证最优继续方案。在单防御者和多防御者设置中,这种早期终止方法可实现10-20%的更高奖励、更快的收敛速度以及更高效的搜索轨迹。广泛的实验验证了这些发现,并展示了整体方法的有效性。

关键词

引用

@article{arxiv.2603.15907,
  title  = {Game-Theory-Assisted Reinforcement Learning for Border Defense: Early Termination based on Analytical Solutions},
  author = {Goutam Das and Michael Dorothy and Kyle Volle and Daigo Shishika},
  journal= {arXiv preprint arXiv:2603.15907},
  year   = {2026}
}

备注

7 pages, ACC 2026