认知雷达感知与感知-动作策略的联合逆向学习
信号处理
2026-03-10 v1
摘要
认知雷达(CR)采用感知-动作循环根据其对目标运动状态和任务目标的感知来调整其感知和传输策略。本文考虑一种逆向学习电子对抗干扰(ECM),从雷达的动作(即雷达对目标采用的感知和传输动作)推断出该对手 CR 的感知及其感知驱动的动作策略。文献中现有的框架假设已知感知或感知-动作策略中的一个,推断另一个。然而,这种假设在对抗环境下并不现实。我们通过提出一种在线、非参数贝叶斯机器学习框架,并开发逆向粒子滤波算法(IPFDDP),来弥补这一差距。IPFDDP 使用依赖性狄利克雷过程(DDP)表征感知依赖的动作策略,并将基于核的 DDP 推断嵌入贝叶斯逆向粒子滤波框架,以联合估计雷达的感知及其感知-动作策略。大量数值仿真结果表明,IPFDDP 在均方误差、估计策略与真实策略之间的 KL 散度以及识别相对动作偏好方面均优于现有的逆向学习方法。与现有技术不同,所提贝叶斯表述自然量化推断感知及其感知-动作策略的不确定性,实现基于主动探测的样本高效逆向学习。仿真结果表明,集成主动探测的 IPFDDP 在 KL 散度的平均减少速度上比随机探测快约40%。
引用
@article{arxiv.2603.07051,
title = {Joint Inverse Learning of Cognitive Radar Perception and Perception-Action Policy},
author = {Anoop C and Anup Aprem},
journal= {arXiv preprint arXiv:2603.07051},
year = {2026}
}