中文

基于预算约束非参数函数逼近的强化学习在机会频谱接入中的应用

信息论 2018-06-22 v2 机器学习 math.IT 机器学习

摘要

机会频谱接入是最大化拥塞频段吞吐量的一项新兴技术,其通过预测频谱中的空闲时隙来实现。我们提出了一种基于核的强化学习方法,结合一种新颖的预算约束稀疏化技术,能够高效捕捉环境以找到最佳信道接入动作。该方法允许在内在的状态-动作空间上进行学习与规划,并能很好地扩展至大型状态空间。我们应用所提方法评估了基于强化学习的无线电与多信道对抗无线电及单信道 CSMA-CA 无线电的共存情况。数值实验表明,其性能优于载波侦听系统。

关键词

引用

@article{arxiv.1706.04546,
  title  = {Reinforcement Learning with Budget-Constrained Nonparametric Function Approximation for Opportunistic Spectrum Access},
  author = {Theodoros Tsiligkaridis and David Romero},
  journal= {arXiv preprint arXiv:1706.04546},
  year   = {2018}
}

备注

6 pages, submitted