中文

CORE:以可补偿奖励为催化剂提升无线网络中的离线强化学习

网络与互联网体系结构 2025-12-23 v1

摘要

现实的无线数据昂贵且往往缺乏足够的专家演示,导致现有的离线 RL 方法过拟合次优行为并表现不稳定。为了解决这个问题,我们提出了一个专为无线环境设计的离线 RL 框架 CORE。 CORE 通过行为嵌入聚类识别来自噪声数据集中潜在的专家轨迹,并训练一个具有对比目标的条件变分自编码器,以在潜在空间中分离专家和非专家行为。基于学习到的表示,CORE 构建可补偿的奖励,这些奖励反映专家概率,从而有效地指导在有限或不完美监督下的策略学习。更广泛地说,这一工作代表了对离线 RL 在无线网络领域进行系统性探索的早期工作,尽管该领域的先前采用仍有限。除了引入离线 RL 技术到该领域外,我们进一步检查了无线数据固有的特性, develop 一个领域对齐的算法,显式地考虑这些结构属性。虽然离线 RL 在无线社区中尚未完全 established 为标准方法,但我们的研究旨在提供基础见解和实证证据来支持其更广泛的接受。

关键词

引用

@article{arxiv.2512.19671,
  title  = {CORE: Compensable Reward as a Catalyst for Improving Offline RL in Wireless Networks},
  author = {Lipeng Zu and Hansong Zhou and Yu Qian and Shayok Chakraborty and Yukun Yuan and Linke Guo and Xiaonan Zhang},
  journal= {arXiv preprint arXiv:2512.19671},
  year   = {2025}
}