中文

用于抗干扰通信的快速强化学习

信号处理 2020-02-14 v1 机器学习

摘要

本快报提出一种用于抗干扰通信的快速强化学习算法,其以概率 τ\tau 选择先前动作,并以概率 (1τ)(1-\tau) 应用 ϵ\epsilon-贪婪。设计基于前若干动作平均值的动态阈值,并将概率 τ\tau 构造为类高斯函数以引导无线设备。作为具体示例,所提算法在对抗多个干扰机的无线通信系统中实现。实验结果表明,在信干噪比与收敛速率方面,所提算法优于 Q-学习、深度 Q 网络 (DQN)、双重 DQN (DDQN) 及基于优先经验回放的 DDQN (PDDQN)。

关键词

引用

@article{arxiv.2002.05364,
  title  = {Fast Reinforcement Learning for Anti-jamming Communications},
  author = {Pei-Gen Ye and Yuan-Gen Wang and Jin Li and Liang Xiao},
  journal= {arXiv preprint arXiv:2002.05364},
  year   = {2020}
}