中文

元认知:一种面向认知雷达的逆逆强化学习方法

信号处理 2022-05-05 v1 机器学习

摘要

本文研究对抗环境下的元认知雷达。认知雷达针对可能具有对抗性的运动目标所采取的机动(探测)最优地调整其波形(响应)。元认知雷达意识到目标的对抗性质,并试图削弱该对抗目标。元认知雷达应如何选择其响应,以充分迷惑试图估计雷达效用函数的对手?本文将雷达的元认知问题抽象为状态与观测噪声协方差矩阵谱(特征值)的形式,并将代数Riccati方程嵌入基于经济学的效用最大化框架中。该对抗目标是一个逆强化学习器。通过观察雷达响应(波形)的含噪序列,对抗目标使用统计假设检验来检测雷达是否为效用最大化者。相应地,元认知雷达故意选择次优响应,以提高对手检测器的第一类错误概率。我们将元认知雷达采取的这一反对抗步骤称为逆逆强化学习(I-IRL)。我们通过简单的数值例子说明了本文的元认知结果。本文的元认知方法基于微观经济学中的显示偏好理论,并受到机器学习中差分隐私与对抗混淆结果的启发。

关键词

引用

@article{arxiv.2205.01794,
  title  = {Meta-Cognition. An Inverse-Inverse Reinforcement Learning Approach for Cognitive Radars},
  author = {Kunal Pattanayak and Vikram Krishnamurthy and Christopher Berry},
  journal= {arXiv preprint arXiv:2205.01794},
  year   = {2022}
}