基于峰值信息老化违规保证的资源分配安全深度强化学习
信号处理
2025-07-14 v1 人工智能
机器学习
多智能体系统
摘要
在无线网络控制系统(WNCS)中,控制和通信系统必须协同设计,因为它们存在强烈的相互依赖性。本文提出了一种基于优化理论的 novel safe 深度强化学习(DRL)框架,用于超可靠的 WNCS,首次在文献中确保在优化性能的同时满足约束。该方法在关键约束下最小化功耗,包括峰值信息老化违规概率(PAoI)、发射功率和有限块长度下的可调度性。PAoI违规概率通过结合多传感器网络中随机可允许传输间隔(MATI)和可允许数据包延迟(MAD)约束来唯一地推导。该框架包含两个阶段:优化理论和 safe DRL。第一个阶段导出最优条件,以建立变量之间的数学关系,简化并分解问题。第二个阶段采用 safe DRL 模型,其中教师-学生框架引导 DRL 智能体(学生)。控制机制(教师)评估系统约束的合规性,并在需要时建议最近的可行动作。大量仿真结果表明,所提出的框架优于基于规则和其他优化理论 DRL 基准,实现更快的收敛、更高的奖励和更大的稳定性。
引用
@article{arxiv.2507.08653,
title = {Safe Deep Reinforcement Learning for Resource Allocation with Peak Age of Information Violation Guarantees},
author = {Berire Gunes Reyhan and Sinem Coleri},
journal= {arXiv preprint arXiv:2507.08653},
year = {2025}
}
备注
15 Pages, to be published in IEEE Transactions on Communications