面向队列稳定的强化学习 Lyapunov Drift-Plus-Penalty 方法
机器学习
2025-06-06 v1
摘要
随着物联网设备的普及,应对复杂优化挑战的需求日益增长。Lyapunov Drift-Plus-Penalty 算法是确保队列稳定性广泛采用的方法,部分研究已初步探索其与强化学习(RL)的集成。本文调查了将 Lyapunov Drift-Plus-Penalty 算法适用于 RL 应用的做法,经过严格的理论分析,推导出一种在若干常见且合理条件下将两者有效结合的方法。与现有直接合并两种框架的方法不同,我们提出的算法称为 Lyapunov drift-plus-penalty method tailored for reinforcement learning with queue stability(LDPTRLQ)算法,具备理论优势,通过有效平衡 Lyapunov Drift-Plus-Penalty 的贪心优化与 RL 的长期视角。多个问题的仿真结果表明,LDPTRLQ 在使用 Lyapunov drift-plus-penalty 方法和 RL 的基线方法上均表现出优于它们的性能,证实了我们理论推导的有效性。结果还表明,我们提出的算法在兼容性和稳定性方面优于其他基准方法。
引用
@article{arxiv.2506.04291,
title = {A Lyapunov Drift-Plus-Penalty Method Tailored for Reinforcement Learning with Queue Stability},
author = {Wenhan Xu and Jiashuo Jiang and Lei Deng and Danny Hin-Kwok Tsang},
journal= {arXiv preprint arXiv:2506.04291},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication