李雅普诺夫引导的多智能体强化学习用于延迟敏感无线调度
信息论
2024-11-06 v2 math.IT
摘要
本文提出了一种两阶段智能调度器,旨在最小化数据包级别的延迟抖动同时保证延迟边界。首先,利用李雅普诺夫技术将延迟违反约束转化为逐时隙的队列稳定性问题。其次,提出了一种分层方案来解决多个基站与用户之间的资源分配问题,其中多智能体强化学习(MARL)决定用户优先级和调度数据包数量,而底层调度器负责资源分配。我们提出的方案在延迟抖动和延迟违反率方面均优于轮询最早截止时间优先算法以及带有延迟违反惩罚的多智能体强化学习方法。
引用
@article{arxiv.2411.01766,
title = {Lyapunov-guided Multi-Agent Reinforcement Learning for Delay-Sensitive Wireless Scheduling},
author = {Cheng Zhang and Lan Wei and Ji Fan and Zening Liu and Yongming Huang},
journal= {arXiv preprint arXiv:2411.01766},
year = {2024}
}