面向物联网网络中样本高效无人机轨迹设计的模型辅助深度强化学习
信息论
2022-02-07 v3 机器学习
math.IT
摘要
深度强化学习(DRL)正作为一种潜在方法获得关注,用于设计在蜂窝或物联网(IoT)连接背景下用作飞行接入点的自主无人机(UAV)轨迹。DRL 方案具有边走边学的优势,因而仅依赖极少的先验上下文信息。然而相应缺陷在于需要大量学习回合,这严重限制了该方法在现实世界时间与能量受限任务中的适用性。在此,我们提出一种模型辅助深度 Q 学习方法,与以往工作不同,其显著减少了对大量训练数据样本的需求,同时仍实现 DRL 的总体目标,即在无无线信道特性先验知识且无线节点位置信息有限的情况下,引导电池受限的 UAV 沿高效数据采集轨迹飞行。其核心思想在于使用一小部分节点作为锚点(即位置已知),并在隐式估计常规节点位置的同时学习传播环境模型。与该模型的交互使我们能够训练深度 Q 网络(DQN)以逼近最优 UAV 控制策略。我们表明,相较于标准 DRL 方法,所提模型辅助方法达到相同数据收集性能所需的训练数据样本至少少一个数量级,从而为使 DRL 成为该问题的可行方案迈出第一步。
引用
@article{arxiv.2104.10403,
title = {Model-aided Deep Reinforcement Learning for Sample-efficient UAV Trajectory Design in IoT Networks},
author = {Omid Esrafilian and Harald Bayerlein and David Gesbert},
journal= {arXiv preprint arXiv:2104.10403},
year = {2022}
}
备注
6 pages, 2 figures, Accepted in GLOBECOM 2021