基于上下文感知约束强化学习的能效功率调度用于非平稳XR数据流量
系统与控制
2025-03-13 v1 新兴技术
机器学习
系统与控制
摘要
在 XR 下行链路传输中,能效功率调度(EEPS)对于在硬延迟约束下节省功率资源并传输大数据包至关重要。传统的约束强化学习(CRL)算法在 EEPS 中展现出前景,但仍难以应对非凸随机约束、非平稳数据流量以及 XR 中稀疏延迟的数据包丢弃反馈(奖励)。为克服这些挑战,本文将 EEPS 建模为与时变转移函数关联的动态参数约束马尔可夫决策过程(DP-CMDP),并提出一种上下文感知约束强化学习(CACRL)算法对其进行求解,该算法由上下文推理(CI)模块和 CRL 模块组成。CI 模块训练一个编码器和多个候选网络以刻画当前转移函数,并根据上下文重塑数据包丢弃奖励,将原始 DP-CMDP 转化为具有即时密集奖励的通用 CMDP。CRL 模块在该 CMDP 下采用策略网络做出 EEPS 决策,并使用约束随机序贯凸近似(CSSCA)方法优化策略,该方法更适合处理非凸随机约束。最后,理论分析提供了对 CACRL 算法的深入见解,而广泛的模拟实验表明,该算法在功率节省和满足数据包丢弃约束方面均优于先进的基线方法。
引用
@article{arxiv.2503.09391,
title = {Context-aware Constrained Reinforcement Learning Based Energy-Efficient Power Scheduling for Non-stationary XR Data Traffic},
author = {Kexuan Wang and An Liu},
journal= {arXiv preprint arXiv:2503.09391},
year = {2025}
}