基于奖励机器的移动网络睡眠控制强化学习
机器学习
2026-04-10 v1 人工智能
摘要
移动网络中的能源效率对于可持续电信设施至关重要,特别是随着网络密集化不断增加能源消耗。移动网络组件的睡眠机制可减少能源使用,但决定Which 组件睡眠、何时以及多长时间以保持服务质量(QoS)仍是一个困难的优化问题。本文利用带奖励机器(RM)的强化学习进行睡眠控制决策,在平衡即时能源节省和长期 QoS 影响(即对截止约束流量的时间平均丢包率和对恒定速率用户的时间平均最低吞吐保证)方面发挥作用。一个挑战在于,时间平均约束依赖于时间累积的性能而非即时性能。因此,有效奖励是非马尔可夫的,最优动作取决于操作历史而非瞬时系统状态。RM 通过维护抽象状态来跟踪 QoS 约束违规情况,显式地处理历史依赖性。我们的框架为在多样化流量模式和 QoS 要求下的下一代移动网络能源管理提供了原则化、可扩展的方法。
引用
@article{arxiv.2604.07411,
title = {Reinforcement Learning with Reward Machines for Sleep Control in Mobile Networks},
author = {Kristina Levina and Nikolaos Pappas and Athanasios Karapantelakis and Aneta Vulgarakis Feljan and Jendrik Seipp},
journal= {arXiv preprint arXiv:2604.07411},
year = {2026}
}
备注
Under review