中文

马尔可夫决策过程的最小可推断策略

最优化与控制 2018-09-19 v1

摘要

在多种应用中,智能体的成功取决于对抗性观察者已掌握或能够收集到的关于智能体决策的知识。因此,智能体希望在完成任务的同时降低观察者推断其策略的能力。我们将智能体的任务视为马尔可夫决策过程中的可达性问题,并研究综合能够最小化观察者推断智能体在马尔可夫决策过程各状态间转移概率之能力的策略。我们引入一种基于 Fisher 信息的度量,作为泄露给观察者的信息的代理,并利用该度量构建了一个在可达性约束下最小化期望总信息的问题。我们进而使用凸优化方法求解该问题。为验证所提方法,我们分析了期望总信息与观察者估计误差之间的关系,并证明对于一类特定的马尔可夫决策过程,这两个值成反比。

关键词

引用

@article{arxiv.1809.06482,
  title  = {Least Inferable Policies for Markov Decision Processes},
  author = {Mustafa O. Karabag and Melkior Ornik and Ufuk Topcu},
  journal= {arXiv preprint arXiv:1809.06482},
  year   = {2018}
}