中文

一种针对多信道会合问题的强化学习方法

信号处理 2020-09-22 v2 机器学习

摘要

在本文中,我们考虑认知无线电网络(CRNs)中的多信道会合问题,其中两个用户在相同信道上跳频并成功会合的概率是信道状态的函数。信道状态由具有好状态和坏状态的两状态马尔可夫链建模。这些信道状态对用户不可观测。对于此类多信道会合问题,我们感兴趣的是在动态盲会合策略(即在第 tt 个时隙每个用户以概率 pi(t)p_i(t) 独立选择信道 iii=1,2,,Ni=1,2, \ldots, N)这一类策略中,寻找最优策略以最小化期望会合时间(ETTR)。通过将此类多信道会合问题表述为对抗式赌博机问题,我们提出使用强化学习方法来学习信道选择概率 pi(t)p_i(t)i=1,2,,Ni=1,2, \ldots, N。实验结果表明,强化学习方法非常有效,与文献中的各种近似策略相比,其 ETTR 相当。

关键词

引用

@article{arxiv.1907.01919,
  title  = {A Reinforcement Learning Approach for the Multichannel Rendezvous Problem},
  author = {Jen-Hung Wang and Ping-En Lu and Cheng-Shang Chang and Duan-Shin Lee},
  journal= {arXiv preprint arXiv:1907.01919},
  year   = {2020}
}

备注

5 pages, 9 figures. arXiv admin note: text overlap with arXiv:1906.10424