通过安全强化学习实现垃圾环境下的最优时间飞行
机器人学
2024-07-01 v1
摘要
本文解决的问题是引导四旋翼飞行器穿过预定义的航路点序列,同时在杂乱环境中避免碰撞,目标是最小化飞行时间。以前的方法要么因解决复杂非凸优化问题而导致计算时间延长,要么受限于多项式轨迹表示的固有光滑性,从而限制了运动的灵活性。本文提出了一种用于自主无人机赛跑的安全强化学习方法,以实现杂乱环境中的最优时间飞行。强化学习策略通过设计专用于强制近似最优和无碰撞飞行的安全奖励和终端奖励进行训练,超过当前最先进算法。此外,实验结果表明,所提出的方法在实现最小飞行时间和障碍规避目标方面在复杂环境中有效,尤其在未见的具有挑战性的环境中实现了令人瞩目的66.7%成功率。
引用
@article{arxiv.2406.19646,
title = {Time-optimal Flight in Cluttered Environments via Safe Reinforcement Learning},
author = {Wei Xiao and Zhaohan Feng and Ziyu Zhou and Jian Sun and Gang Wang and Jie Chen},
journal= {arXiv preprint arXiv:2406.19646},
year = {2024}
}
备注
7 pages, 3 figures,