中文

基于混合数据集的离线强化学习用于无线网络优化

信息论 2023-11-21 v1 机器学习 网络与互联网体系结构 信号处理 math.IT

摘要

近年来强化学习(RL)的发展推动了在线RL在无线射频资源管理(RRM)中的应用。然而,在线RL算法需要与环境直接交互,鉴于RL中不可避免的探索可能导致性能损失,这种做法可能并不可取。本文中,我们首先研究使用离线RL算法求解RRM问题。我们评估了若干最先进的离线RL算法,包括行为约束Q学习(BCQ)、保守Q学习(CQL)与隐式Q学习(IQL),用于一个特定的RRM问题,该问题旨在通过用户调度最大化求和速率与5分位速率的线性组合。我们观察到,离线RL在该RRM问题上的性能关键取决于用于数据收集的行为策略,并进一步提出了一种利用不同行为策略收集的异构数据集的新型离线RL方案。我们表明,通过对数据集进行适当混合,即使所有涉及的行为策略都高度次优,离线RL也能产生近最优的RL策略。

关键词

引用

@article{arxiv.2311.11423,
  title  = {Offline Reinforcement Learning for Wireless Network Optimization with Mixture Datasets},
  author = {Kun Yang and Cong Shen and Jing Yang and Shu-ping Yeh and Jerry Sydir},
  journal= {arXiv preprint arXiv:2311.11423},
  year   = {2023}
}

备注

This paper is the camera ready version for Asilomar 2023