中文

最优控制中的欺骗

最优化与控制 2018-05-09 v1 人工智能 系统与控制

摘要

本文考虑一种对抗场景:一方智能体力求达成目标,而其对手试图推断该智能体的意图并阻止其达成目标。智能体有动机在努力达成目标的同时,试图欺骗对手以掩盖其意图。本文的主要贡献是在最优控制框架下引入关于欺骗概念的数学严格表述。文中引入的核心概念是信念诱导奖励:其不仅依赖于智能体的状态与动作,也依赖于对手的信念。于是最优欺骗策略的设计成为智能体状态空间与对手信念空间之积上的最优控制设计问题。所提框架允许在任意配备奖励函数及限制智能体控制策略的附加规约的控制系统中定义欺骗。除定义欺骗外,我们讨论了在智能体关于对手学习过程存在认知不确定时最优欺骗策略的设计。在本文后半部分,我们聚焦于智能体行为由马尔可夫决策过程支配的情形,并表明在缺乏对手知识下的最优欺骗策略设计自然归约为部分可观或不确定马尔可夫决策过程控制设计中已有讨论的问题。最后,我们给出两个欺骗策略示例:“警察与强盗”场景以及一个智能体运动中可运用伪装的例子。我们表明此类示例中的最优欺骗策略符合在上述设定下欺骗对手的直观思路。

关键词

引用

@article{arxiv.1805.03090,
  title  = {Deception in Optimal Control},
  author = {Melkior Ornik and Ufuk Topcu},
  journal= {arXiv preprint arXiv:1805.03090},
  year   = {2018}
}