中文

规避干扰机:一种强化学习方法

机器学习 2019-11-28 v2 信号处理 机器学习

摘要

本文在部分可观测马尔可夫决策过程(POMDP)模型下研究认知雷达的抗干扰性能。首先,我们得到了干扰机动力学不确定性的显式表达式,这为在传统的基于信噪比(SNR\mathsf{SNR})的分析之外阐明雷达被干扰概率这一性能指标铺平了道路。考虑到在强化学习(RL)框架下开发的两种跳频策略,该性能指标在深度 Q 网络(DQN)与长短期记忆(LSTM)网络下针对不同不确定性值进行了分析。最后,两种网络架构的 RL 算法中对目标网络的需求被一个 softmax 算子取代。仿真结果表明,该算子改进了传统目标网络的性能。

关键词

引用

@article{arxiv.1911.08874,
  title  = {Avoiding Jammers: A Reinforcement Learning Approach},
  author = {Serkan Ak and Stefan Bruggenwirth},
  journal= {arXiv preprint arXiv:1911.08874},
  year   = {2019}
}