面向目标的传输调度:基于结构引导的 DRL 与统一在策略/离策略方法
信息论
2025-01-22 v1 人工智能
机器学习
系统与控制
信号处理
系统与控制
math.IT
摘要
面向目标的通信优先考虑应用驱动的目标而非数据准确性,使能智能化的下一代无线系统。在多设备、多信道系统中,由于状态与动作空间维度高,高效调度面临重大挑战。我们通过推导面向目标的调度问题最优解的关键结构性质来应对这些挑战,并结合信息年龄(Age of Information, AoI)与信道状态。具体而言,我们建立了最优状态值函数(衡量长期系统性能的指标)相对于信道状态的单调性,并证明了其相对于 AoI 状态的渐近凸性。此外,我们还推导了最优策略相对于信道状态的单调性,推进了最优调度的理论框架。利用这些洞见,我们提出了结构引导的统一在策略/离策略 DRL(SUDO-DRL),这是一种将在线策略训练的稳定性与离线策略方法的样本效率相结合的混合算法。通过一种新颖的结构性质评估框架,SUDO-DRL 实现了有效且可扩展的训练,应对了大规模系统的复杂性。数值结果表明,相较于最先进的方法,SUDO-DRL 将系统性能提升高达 45%,并将收敛时间缩短 40%。它还能有效处理远更大规模系统中的调度问题——在这些系统中,离策略 DRL 失效,而在策略基准表现出显著的性能损失——展示了其在面向目标通信中的可扩展性与有效性。
引用
@article{arxiv.2501.11921,
title = {Goal-oriented Transmission Scheduling: Structure-guided DRL with a Unified Dual On-policy and Off-policy Approach},
author = {Jiazheng Chen and Wanchun Liu},
journal= {arXiv preprint arXiv:2501.11921},
year = {2025}
}
备注
Paper submitted to IEEE