面向物理层通信的强化学习
人工智能
2021-07-02 v2 机器学习
网络与互联网体系结构
信号处理
摘要
在本章中,我们将通过定义不同类别的问题及可能的处理方法,给出将强化学习(RL)应用于优化无线通信物理层的全面示例。在 9.2 节,我们给出解决 RL 问题所需的所有基础理论,即马尔可夫决策过程(MDP)、部分可观测马尔可夫决策过程(POMDP),以及两种非常重要且广泛使用的 RL 算法,即 Q-learning 和 SARSA 算法。我们还介绍了深度强化学习(DRL)范式,并在本节末尾引入多臂老虎机(MAB)框架。9.3 节聚焦于一些简化示例,以说明 RL 的基本概念如何用于通信系统。我们给出取自文献、采用与本章 9.2 节相似记号的简化系统模型的应用。在 9.3 节中,我们还关注 RL 问题的建模,即动作空间、状态空间与奖励如何选取。本章在 9.4 节以对 RL 趋势的前瞻思考作结,并在 9.5 节以对更广泛研究现状的综述结束。
引用
@article{arxiv.2106.11595,
title = {Reinforcement Learning for Physical Layer Communications},
author = {Philippe Mary and Visa Koivunen and Christophe Moy},
journal= {arXiv preprint arXiv:2106.11595},
year = {2021}
}
备注
Machine Learning and Wireless Communications, In press