中文

用于无线无线电资源管理的平均奖励强化学习

信息论 2025-01-14 v1 机器学习 网络与互联网体系结构 信号处理 math.IT

摘要

在本文中,我们探讨了将强化学习(RL)应用于无线通信中的无线电资源管理(RRM)时一个关键但常被忽视的问题:折扣奖励RL公式与无线网络优化的无折扣目标之间的不匹配。据我们所知,我们首次系统地研究了这一差异,首先讨论了问题建模,随后通过仿真量化了该差距的程度。为了弥合这一差距,我们引入了平均奖励RL的使用,这是一种与RRM的长期目标更为契合的方法。我们提出了一种名为平均奖励离策略软演员-评论家(ARO SAC)的新方法,该方法是对著名的软演员-评论家算法在平均奖励框架下的改进。我们的仿真结果表明,与传统折扣奖励RL方法相比,这种新方法实现了显著的性能提升,系统性能提高了15%,凸显了平均奖励RL在提升无线网络优化效率和有效性方面的潜力。

关键词

引用

@article{arxiv.2501.06700,
  title  = {Average Reward Reinforcement Learning for Wireless Radio Resource Management},
  author = {Kun Yang and Jing Yang and Cong Shen},
  journal= {arXiv preprint arXiv:2501.06700},
  year   = {2025}
}

备注

Accepted by Asilomar 2024