一种带连通性约束的飞行器导航双Q学习方法
人工智能
2020-02-26 v1 网络与互联网体系结构
信号处理
摘要
本文研究一架飞行器在给定初始与最终位置对之间飞行的轨迹优化问题。目标是最小化飞行器飞行时间,同时确保满足飞行器安全操作所需的通信连通性约束。我们考虑了飞行器连通性约束的两种不同准则,对应两种不同场景。在第一种场景中,我们假设飞行器脱离地面基站(GBSs)覆盖的最大连续时长被限制于给定阈值。而在第二种场景中,我们假设飞行器未被GBSs覆盖的总时段受限。基于这两种约束,我们构建了两个轨迹优化问题。为求解这些非凸问题,我们采用基于双Q学习(double Q-learning)的方法,这是一种无模型强化学习技术,与现有算法不同,其不需要环境的完备知识。此外,相较于著名的Q学习技术,我们的双Q学习算法不存在过估计问题。仿真结果表明,尽管我们的算法不需要环境先验信息,其表现良好并展现出近最优性能。
引用
@article{arxiv.2002.10563,
title = {A Double Q-Learning Approach for Navigation of Aerial Vehicles with Connectivity Constraint},
author = {Behzad Khamidehi and Elvino S. Sousa},
journal= {arXiv preprint arXiv:2002.10563},
year = {2020}
}
备注
Accepted to appear in IEEE ICC 2020