基于上下文汤普森采样的认知雷达-蜂窝共存高效在线学习
信息论
2020-08-25 v1 机器学习
math.IT
摘要
本文描述了一种用于自适应雷达发射的序列或在线学习方案,该方案促进与非协作蜂窝网络的频谱共享。首先,对雷达与空间上遥远的蜂窝网络之间的干扰信道进行建模。然后,应用线性上下文多臂老虎机(CB)学习框架来驱动雷达的行为。所提出的汤普森采样(TS)算法平衡了探索与利用之间的基本权衡,这是一种伪贝叶斯方法,其在给定折扣信道信息作为上下文的条件下,基于特定波形为最优的后验概率来选择波形参数。结果表明,相比于可比较的上下文多臂老虎机算法,上下文 TS 方法更快地收敛到使互干扰最小化和频谱利用率最大化的行为。此外,我们表明 TS 学习方案与其他在线学习算法相比产生了有利的 SINR 分布。最后,将所提出的 TS 算法与深度强化学习模型进行比较。我们表明 TS 算法与更复杂的深度 Q 网络(DQN)保持竞争性能。
引用
@article{arxiv.2008.10149,
title = {Efficient Online Learning for Cognitive Radar-Cellular Coexistence via Contextual Thompson Sampling},
author = {Charles E. Thornton and R. Michael Buehrer and Anthony F. Martone},
journal= {arXiv preprint arXiv:2008.10149},
year = {2020}
}
备注
6 pages, 6 Figures, To Appear in Proc. IEEE GLOBECOM 2020, Taipei Taiwan