基于部分可观测强化学习的 RIS 和 MA 辅助多无人机 SAGIN 绿色紧急通信
系统与控制
2025-11-18 v1 系统与控制
摘要
在灾后空间-空中-地面集成网络(SAGINs)中,地面基础设施常受损,无人机(UAV)必须在狭窄的非直线视距(NLoS)城市环境中快速恢复为关键地面终端提供连接性。为增强覆盖范围,UAV 采用可移动天线(MAs),而基于剩余的高楼栋上的可重构智能表面(RIS)则将信号定向重定向。关键挑战在于通信受限的部分可观测性,使得每个 UAV 仅拥有受限且快速变化的邻域视图,从而 destabilizes 价值估计。现有的多智能体强化学习(MARL)方法不够——非通信方法依赖于不可用的全局批评者,启发式共享方法脆弱且冗余,而可学习协议(如 CommNet、DIAL)丢失了每邻居结构,并在受限带宽下加剧了非平稳性。为解决部分可观测性问题,我们提出一种时空 A2C,其中每个 UAV 发送包含局部状态、紧凑策略指纹和循环信念的先决决策消息,这些消息按邻居编码并拼接。空间折扣塑造价值目标以强调局部互动,而在单跳-时隙延迟下进行分析解释了具有延迟视图的稳定训练。实验结果表明,我们的策略在 IA2C、ConseNet、FPrint、DIAL 和 CommNet 方面均优于后者——实现更快收敛、更高的渐近奖励、较低的时序-差分(TD)/优势误差以及更好的通信吞吐-能耗权衡。
引用
@article{arxiv.2511.12892,
title = {Green Emergency Communications in RIS- and MA-Assisted Multi-UAV SAGINs: A Partially Observable Reinforcement Learning Approach},
author = {Liangshun Wu and Wen Chen and Shunqing Zhang and Yajun Wang and Kunlun Wang},
journal= {arXiv preprint arXiv:2511.12892},
year = {2025}
}