中文

拥挤频谱环境下用于雷达探测与跟踪的深度强化学习控制

信号处理 2020-08-28 v3 信息论 机器学习 math.IT

摘要

本文中,通过将基于深度强化学习(Deep RL)的非线性值函数近似应用于认知脉冲雷达与邻近通信系统之间的动态非合作共存问题,开发出一种实现最优雷达性能的策略。雷达学习改变其线性调频(LFM)波形的带宽与中心频率,以减轻与其他系统的互干扰并改善目标探测性能,同时保持可用频带足够的利用率以满足精细距离分辨率需求。我们证明,基于深度 Q 学习(DQL)算法的方法,在多种现实共存环境中,比策略迭代或感知规避(SAA)方法更有效地提升了包括 SINR 与带宽利用率在内的关键雷达指标。我们还将基于 DQL 的方法扩展以纳入双重 Q 学习与循环神经网络,形成双重深度循环 Q 网络(DDRQN)。我们证明 DDRQN 相较于 DQL 与策略迭代具有更优的性能与稳定性。最后,我们通过讨论在软件定义雷达(SDRadar)原型系统上进行的实验,论证了所提方法的实用性。实验结果表明,相较于策略迭代与 SAA,所提深度 RL 方法在拥挤频谱环境下显著改善了雷达探测性能。

关键词

引用

@article{arxiv.2006.13173,
  title  = {Deep Reinforcement Learning Control for Radar Detection and Tracking in Congested Spectral Environments},
  author = {Charles E. Thornton and Mark A. Kozy and R. Michael Buehrer and Anthony F. Martone and Kelly D. Sherbondy},
  journal= {arXiv preprint arXiv:2006.13173},
  year   = {2020}
}

备注

To Appear in IEEE Transactions on Cognitive Communications and Networking, 2020