中文

一种用于理性且持久机器人欺骗的动态博弈框架及其在欺骗性追逃中的应用

系统与控制 2021-07-29 v3 计算机科学与博弈论 系统与控制

摘要

本文研究智能机器人之间的理性且持久欺骗,以提升安全性与运行效率。我们提出了一个具有非对称信息结构的N人K阶段博弈,其中每个机器人的私有信息被建模为随机变量或其类型。欺骗是持久的,因为每个机器人的私有类型在所有阶段对其他机器人保持未知。欺骗是理性的,因为机器人旨在以最小代价实现其欺骗目标。每个机器人基于内在或外在信息形成对他人类型的动态信念。完美贝叶斯纳什均衡(PBNE)是不完全信息动态博弈的自然解概念。由于其序贯理性与信念一致性的要求,PBNE提供了对玩家行动、信念及整个K阶段预期累积成本的可靠预测。本工作的贡献有四点。首先,我们将PBNE计算识别为非线性随机控制问题,并刻画了PBNE下玩家行动与成本的结构。我们进一步在线性二次(LQ)设定与外在信念动力学下导出了一组具有认知耦合的扩展Riccati方程。其次,我们开发了一种具有低时间复杂度和空间复杂度的滚动时域算法,以在内在信念动力学下计算PBNE。第三,我们研究了一个欺骗性追逃博弈作为案例,并使用数值实验证实结果。最后,我们提出了诸如可欺骗性、可达性和欺骗代价(PoD)等指标,以评估策略设计及欺骗下的系统性能。

关键词

引用

@article{arxiv.1907.00459,
  title  = {A Dynamic Game Framework for Rational and Persistent Robot Deception With an Application to Deceptive Pursuit-Evasion},
  author = {Linan Huang and Quanyan Zhu},
  journal= {arXiv preprint arXiv:1907.00459},
  year   = {2021}
}