用于无线无线电资源管理的平均奖励强化学习
信息论
2025-01-14 v1 机器学习
网络与互联网体系结构
信号处理
math.IT
摘要
在本文中,我们探讨了将强化学习(RL)应用于无线通信中的无线电资源管理(RRM)时一个关键但常被忽视的问题:折扣奖励RL公式与无线网络优化的无折扣目标之间的不匹配。据我们所知,我们首次系统地研究了这一差异,首先讨论了问题建模,随后通过仿真量化了该差距的程度。为了弥合这一差距,我们引入了平均奖励RL的使用,这是一种与RRM的长期目标更为契合的方法。我们提出了一种名为平均奖励离策略软演员-评论家(ARO SAC)的新方法,该方法是对著名的软演员-评论家算法在平均奖励框架下的改进。我们的仿真结果表明,与传统折扣奖励RL方法相比,这种新方法实现了显著的性能提升,系统性能提高了15%,凸显了平均奖励RL在提升无线网络优化效率和有效性方面的潜力。
引用
@article{arxiv.2501.06700,
title = {Average Reward Reinforcement Learning for Wireless Radio Resource Management},
author = {Kun Yang and Jing Yang and Cong Shen},
journal= {arXiv preprint arXiv:2501.06700},
year = {2025}
}
备注
Accepted by Asilomar 2024