中文

监督控制中的欺骗

最优化与控制 2023-01-04 v2

摘要

在对抗性环境中,试图不暴露意图的智能体使用欺骗性策略十分重要。我们考虑这样一种设定:监督者提供参考策略,并期望智能体遵循该参考策略完成任务。而智能体可能转而遵循不同的欺骗性策略以实现不同任务。我们用马尔可夫决策过程对环境及智能体行为建模,用可达性规范表示智能体与监督者的任务,并研究此类智能体最优欺骗策略的综合。我们还研究最优参考策略的综合,以阻止智能体的欺骗策略并以高概率实现监督者任务。我们证明最优欺骗策略的综合可表述为凸优化问题,而最优参考策略的综合需要求解非凸优化问题。我们还证明最优参考策略的综合是NP难的。

关键词

引用

@article{arxiv.1902.00590,
  title  = {Deception in Supervisory Control},
  author = {Mustafa O. Karabag and Melkior Ornik and Ufuk Topcu},
  journal= {arXiv preprint arXiv:1902.00590},
  year   = {2023}
}

备注

21 pages