中文

面向马尔可夫决策过程的反检测最优与滚动时域控制

系统与控制 2019-08-22 v1 系统与控制 最优化与控制

摘要

本文考虑一个马尔可夫决策过程(MDP),其中自主智能体在追求其名义目标的同时,需要隐藏自身状态以规避对手检测。在给出问题形式化描述后,我们首先提出一种值迭代(VI)方法予以求解。为克服“维数灾难”从而提升对更大规模问题的可扩展性,我们进而提出一种滚动时域优化(RHO)方法以获得近似解。我们通过示例对VI与RHO方法进行说明与比较,并展示了我们所提问题形式化描述在实际应用中的潜力。

关键词

引用

@article{arxiv.1908.07691,
  title  = {Detection-averse optimal and receding-horizon control for Markov decision processes},
  author = {Nan Li and Ilya Kolmanovsky and Anouck Girard},
  journal= {arXiv preprint arXiv:1908.07691},
  year   = {2019}
}

备注

9 pages, 5 figures