中文

基于深度强化学习的无限时域可达-避免零和博弈

系统与控制 2024-09-19 v3 人工智能 机器学习 系统与控制 最优化与控制

摘要

本文考虑无限时域可达-避免零和博弈问题,目标是找到状态空间中的一个集合(称为可达-避免集),使得从该集合中状态出发的系统能够在最坏扰动下被控制到达给定目标集而不违反约束。我们通过设计一个具有收缩Bellman备份的新值函数来解决该问题,其中超零水平集(即值函数评估为非负的状态集)恢复了可达-避免集。在此基础上,我们证明所提方法可适用于计算生存核(即能够被控制以满足给定约束的状态集)和后向可达集(即能够被驱动至给定目标集的状态集)。最后,我们提出通过扩展保守Q学习(一种深度强化学习技术)来缓解高维问题中的维数灾难,学习一个值函数,使得学习到的值函数的超零水平集作为可达-避免集的(保守)近似。我们的理论和实证结果表明,即使使用神经网络近似,所提方法也能可靠地学习可达-避免集和最优控制策略。

关键词

引用

@article{arxiv.2203.10142,
  title  = {Infinite-Horizon Reach-Avoid Zero-Sum Games via Deep Reinforcement Learning},
  author = {Jingqi Li and Donggun Lee and Somayeh Sojoudi and Claire J. Tomlin},
  journal= {arXiv preprint arXiv:2203.10142},
  year   = {2024}
}