面向SAGIN-supported UAV mobility management的无QoS感知层级强化学习
信号处理
2025-12-18 v1 人工智能
摘要
由于无人机( UAV)的高度和水平移动存在显著变化, 单个网络难以确保连续可靠的三维覆盖。为此, 空间-空中-地面一体化网络(SAGIN)作为实现普遍UAV连接性的关键架构。本文将SAGIN中的UAV mobility management问题形式化为受限多目标联合优化问题, 将离散链路选择与连续轨迹优化耦合。基于此, 我们提出一种两层多智能体层级深度强化学习(HDRL)框架, 将问题分解为两个交替求解的子问题。为将复杂链路选择决策映射为紧凑的离散动作空间, 我们构思了双深度Q网络(DDQN)算法用于顶层, 通过双Q值估计实现稳定且高质量的策略学习。为处理连续轨迹动作空间并满足质量服务(QoS)约束, 我们集成软演员-评论家(SAC)的最大熵机制, 并采用拉格朗日方法的受限SAC(CSAC)算法用于底层, 动态调整拉格朗日乘子以平衡约束满足与策略优化。此外, 该算法可扩展至多UAV场景, 基于集中训练、分布执行(CTDE)范式, 实现更通用的策略。仿真结果表明, 所提方案在吞吐量、链路切换频率和QoS满足度方面显著优于现有基准方法。
引用
@article{arxiv.2512.15119,
title = {QoS-Aware Hierarchical Reinforcement Learning for Joint Link Selection and Trajectory Optimization in SAGIN-Supported UAV Mobility Management},
author = {Jiayang Wan and Ke He and Yafei Wang and Fan Liu and Wenjin Wang and Shi Jin},
journal= {arXiv preprint arXiv:2512.15119},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication