中文

识别认知雷达——基于显示性偏好的逆强化学习

信号处理 2023-07-19 v3 机器学习

摘要

我们考虑一个涉及我方与装备贝叶斯跟踪器的敌方雷达之间的逆强化学习问题。通过观察敌方雷达的发射信号,我们如何识别该雷达是否为认知雷达(受约束的效用最大化者)?给定观察到的敌方雷达动作序列,我们考虑三个问题:(i) 敌方雷达的动作(波形选择、波束调度)是否与受约束的效用最大化一致?若是,我们如何估计与其动作一致的认知雷达效用函数。我们依据状态与观测噪声协方差矩阵的特征谱(特征值)以及代数黎卡提方程来表述并求解该问题。(ii) 当我们在噪声中观察雷达动作或雷达在噪声中观察我们的探测信号时,如何构造用于检测认知雷达(受约束的效用最大化)的统计检验?我们提出了一种具有紧致第二类错误界(Type-II error bound)的统计检测器。(iii) 在限定第一类检测错误(Type-I detection error)的约束下,我们如何通过选择自身状态来最优地探测( interrogate)敌方雷达,以最小化检测雷达是否采用经济理性策略的第二类错误?我们提出一种随机优化算法来优化我们的探测信号。本文使用的主要分析框架来自微观经济学的显示性偏好。

关键词

引用

@article{arxiv.1912.00331,
  title  = {Identifying Cognitive Radars -- Inverse Reinforcement Learning using Revealed Preferences},
  author = {Vikram Krishnamurthy and Daniel Angley and Robin Evans and William Moran},
  journal= {arXiv preprint arXiv:1912.00331},
  year   = {2023}
}