使用无人机求解奖励收集问题:在线优化与 Q-learning 的比较
机器学习
2021-12-02 v1 最优化与控制
摘要
无人自主飞行器 (UAV) 在过去的美国军事行动中为侦察与监视任务作出了重大贡献。随着 UAV 的普及,反 UAV 技术也有所进步,使其难以在感兴趣区域内成功获取有价值的情报。因此,现代 UAV 能够在最大化生存机会的同时完成任务变得十分重要。在这项工作中,我们具体研究从指定起点到目标识别一条短路径的问题,同时收集所有奖励并避开在网格上随机移动的对手。我们还提供了一个该框架在军事环境中的可能应用,即自主伤员后送。我们提出了三种解决该问题的方法的比较:即我们实现了一个 Deep Q-Learning 模型、一个 -greedy 表格 Q-Learning 模型和一个在线优化框架。我们使用带有随机对手的简单网格世界环境设计的计算实验展示了这些方法的工作方式,并从性能、准确性和计算时间方面对它们进行了比较。
引用
@article{arxiv.2112.00141,
title = {Solving reward-collecting problems with UAVs: a comparison of online optimization and Q-learning},
author = {Yixuan Liu and Chrysafis Vogiatzis and Ruriko Yoshida and Erich Morman},
journal= {arXiv preprint arXiv:2112.00141},
year = {2021}
}