中文

面向多用户时延约束调度的离线评论家引导扩散策略

人工智能 2025-01-23 v1

摘要

有效的多用户时延约束调度在即时通讯、直播和数据中心管理等各种实际应用中至关重要。在这些场景中,调度器必须做出实时决策,以满足时延和资源约束,而无需预先了解系统动态,这些动态通常是时变的且难以估计。当前基于学习的方法通常在训练阶段需要与实际系统进行交互,这可能很困难或不切实际,因为它会显著降低系统性能并产生大量服务成本。为了应对这些挑战,我们提出了一种新颖的基于离线强化学习的算法,命名为 \underline{S}cheduling \underline{B}y \underline{O}ffline \underline{L}earning with \underline{C}ritic \underline{G}uidance and \underline{D}iffusion \underline{G}eneration (SOCD),纯粹从预收集的 \emph{离线数据} 中学习高效的调度策略。SOCD 创新性地采用了基于扩散的策略网络,并辅以无采样评论家网络进行策略引导。通过将 Lagrange 乘子优化集成到离线强化学习中,SOCD 仅从可用数据集中训练高质量的约束感知策略,消除了与系统在线交互的需要。实验结果表明,SOCD 对各种系统动态具有鲁棒性,包括部分可观测和大规模环境,并且与现有方法相比具有卓越的性能。

关键词

引用

@article{arxiv.2501.12942,
  title  = {Offline Critic-Guided Diffusion Policy for Multi-User Delay-Constrained Scheduling},
  author = {Zhuoran Li and Ruishuo Chen and Hai Zhong and Longbo Huang},
  journal= {arXiv preprint arXiv:2501.12942},
  year   = {2025}
}