中文

面向下一代无人机空中走廊的面向特定场站的无线资源管理的数字孪生驱动深度强化学习

信号处理 2026-02-04 v1

摘要

联合基站(BS)关联和多无人机(UAV)空中走廊中的束流选择构成了具有挑战性的无线资源管理(RRM)问题。其驱动因素包括高维动作空间、获取全局信道状态信息(CSI)的高开销、快速变化的传输信道,以及严格的时延要求。传统的组合优化方法虽然接近最优,但在此类动态环境中进行实时操作计算负荷过大。虽然基于学习的方法可以减轻计算复杂度和 CSI 开销,但仍需要大量面向特定场站(site-specific, SS)数据集进行模型训练。这一挑战促使我们开发了一个由数字孪生(Digital Twin, DT)驱动的两阶段优化框架,将基于物理的束 gain 模型与深度强化学习相结合,用于可扩展的在线决策。在第一阶段,我们使用具有地理空间背景、网络信息的高保真雷达追踪求解器构建信道孪生(CT),以捕获 SS 传播特征,并采用双模拟退火算法预计算最优传输束向。第二阶段,我们开发了一个多头近端策略优化(Multi-Head Proximal Policy Optimization, MH-PPO)智能体,采用可扩展的多头 actor-critic 架构,在 DT 生成的信道数据集上进行训练,直接将复杂信道和束状态映射到联合执行 UAV-BS-束关联决策。我们的方法在密集 UAV 场景下,相较于 DQN 和传统启发式优化方案,实现了 44%-121% 和 249%-807% 的显著提升,同时将推理时延降低了多个数量级。这些结果表明,DT 驱动的训练管道能够为面向 SS 部署提供高性能、低时延的 RRM 策略,适用于下一代空中走廊网络的实时资源管理。

关键词

引用

@article{arxiv.2602.03801,
  title  = {Digital-Twin Empowered Deep Reinforcement Learning For Site-Specific Radio Resource Management in NextG Wireless Aerial Corridor},
  author = {Pulok Tarafder and Zoheb Hassan and Imtiaz Ahmed and Danda B. Rawat and Kamrul Hasan and Cong Pu},
  journal= {arXiv preprint arXiv:2602.03801},
  year   = {2026}
}

备注

Submitted for possible publication to IEEE. Paper currently under review. The contents of this paper may change at any time without notice