时空相关环境下智能反射面相移设计的深度强化学习
信息论
2022-11-18 v1 人工智能
新兴技术
机器学习
网络与互联网体系结构
信号处理
math.IT
摘要
本文研究了在时空相关信道环境下,为多发单收(MISO)通信系统设计智能反射面(IRS)相移器的问题,其中目的地可在受限区域内移动。目标是在无限时间范围内最大化接收端信噪比(SNR)的期望和。该问题表述引出了一个马尔可夫决策过程(MDP)。我们提出了一种深度 actor-critic 算法,通过构建状态表示以包含接收机的当前位置以及对应于前一时窗的相移值和接收机位置,从而考虑信道相关性与目的地运动。信道变化性在底层值函数的频谱上诱发高频分量。我们提出用傅里叶核对评论家输入进行预处理,以实现稳定的价值学习。最后,我们研究了将目的地 SNR 作为所设计 MDP 状态组成部分的使用,这是以往工作中的常见做法。我们提供的经验证据表明,当时空相关时,在状态表示中包含 SNR 会以抑制收敛的方式与函数近似相互作用。
引用
@article{arxiv.2211.09726,
title = {Deep Reinforcement Learning for IRS Phase Shift Design in Spatiotemporally Correlated Environments},
author = {Spilios Evmorfos and Athina P. Petropulu and H. Vincent Poor},
journal= {arXiv preprint arXiv:2211.09726},
year = {2022}
}