监督控制中的欺骗
最优化与控制
2023-01-04 v2
摘要
在对抗性环境中,试图不暴露意图的智能体使用欺骗性策略十分重要。我们考虑这样一种设定:监督者提供参考策略,并期望智能体遵循该参考策略完成任务。而智能体可能转而遵循不同的欺骗性策略以实现不同任务。我们用马尔可夫决策过程对环境及智能体行为建模,用可达性规范表示智能体与监督者的任务,并研究此类智能体最优欺骗策略的综合。我们还研究最优参考策略的综合,以阻止智能体的欺骗策略并以高概率实现监督者任务。我们证明最优欺骗策略的综合可表述为凸优化问题,而最优参考策略的综合需要求解非凸优化问题。我们还证明最优参考策略的综合是NP难的。
引用
@article{arxiv.1902.00590,
title = {Deception in Supervisory Control},
author = {Mustafa O. Karabag and Melkior Ornik and Ufuk Topcu},
journal= {arXiv preprint arXiv:1902.00590},
year = {2023}
}
备注
21 pages