中文

基于贝叶斯强化学习的监视规避

机器学习 2023-02-24 v2 最优化与控制

摘要

我们考虑连续设定下的监视规避路径规划任务。逃避者(Evader)力求逃离一个二维区域,同时最小化被探测(并立即捕获)的风险。探测概率依赖于路径,并由空间非均匀的监视强度决定;该强度固定但先验未知,并在多回合设定中逐渐被学习。我们引入一种贝叶斯强化学习算法,其依赖于高斯过程回归(基于先前回合的信息建模监视强度函数)、Hamilton-Jacobi 偏微分方程的数值方法(基于当前模型规划最优连续轨迹)以及置信界(以平衡探索与利用)。我们通过数值实验与后悔度指标,凸显了我们的方法相较于传统基于图的强化学习算法的显著优势。

关键词

引用

@article{arxiv.2109.14811,
  title  = {Surveillance Evasion Through Bayesian Reinforcement Learning},
  author = {Dongping Qi and David Bindel and Alexander Vladimirsky},
  journal= {arXiv preprint arXiv:2109.14811},
  year   = {2023}
}

备注

6 pages, 3 figures; accepted for presentation publication at AISTATS 2023