中文

基于小样本元离线强化学习的弹性无人机轨迹规划

机器人学 2025-02-04 v1 人工智能

摘要

强化学习(RL)一直是未来超5G和6G系统中一个有前景的核心技术。其主要优势在于能够在复杂且高维的无线环境中进行鲁棒的无模型决策。然而,大多数现有RL框架依赖于与环境的在线交互,出于安全和成本考虑,这可能不可行。在线RL的另一个问题是所设计算法在动态或新环境中缺乏可扩展性。本工作提出一种新颖的、具有弹性的少样本元离线RL算法,该算法结合了使用保守Q学习(CQL)的离线RL和使用模型无关元学习(MAML)的元学习。所提算法可以使用静态离线数据集训练RL模型,无需与环境进行任何在线交互。此外,借助MAML,所提模型可以扩展到新的未见环境。我们展示了所提算法用于优化无人机(UAV)的轨迹和调度策略,以最小化有限功率设备的信息年龄(AoI)和传输功率。数值结果表明,所提出的少样本元离线RL算法比基线方案(如深度Q网络和CQL)收敛更快。此外,它是唯一能够使用具有少量数据点的离线数据集实现最优联合AoI和传输功率的算法,并且对由于前所未有的环境变化导致的网络故障具有弹性。

关键词

引用

@article{arxiv.2502.01268,
  title  = {Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning},
  author = {Eslam Eldeeb and Hirley Alves},
  journal= {arXiv preprint arXiv:2502.01268},
  year   = {2025}
}