无状态估计的像素化无人机敏捷飞行演示
机器人学
2024-06-19 v1
摘要
四旋翼机是最具敏捷性的飞行器之一。尽管近期在基于学习的控制和计算机视觉方面取得了进展,但自主无人机仍依赖显式状态估计。相反,人类飞行员仅依赖来自无人机 onboard 摄像头的第一人称视角视频流,以极限姿态推进平台并在未知环境中稳健飞行。我们在知晓方面,首次提出一种基于视觉的四旋翼系统,能够直接将像素映射到控制命令,autonomously navigate through 一系列高速度的 gate。像专业无人机赛车飞行员一样,我们的系统不使用显式状态估计,仅利用人类使用的控制命令(集中推力和身体速率)。我们以最高 40km/h 的速度和最高 2g 的加速度演示了敏捷飞行。这一成果通过强化学习(RL)训练基于视觉的策略实现,训练过程辅以访问特权信息的非对称 actor-critic 结构。为克服基于图像的 RL 训练中的计算复杂度,我们将 gate 的内边缘作为传感器抽象。这种简单且稳健的、与任务相关的表示可在训练时无需渲染图像即可模拟。部署时,使用基于 Swin-transformer 的 gate 检测器。我们的做法使得使用标准、商用的硬件即可实现自主敏捷飞行。虽然我们的演示聚焦于无人机赛车,但我们认为该方法的影响力超越了无人机赛车,可为未来研究在结构化环境中的实际应用奠定基础。
引用
@article{arxiv.2406.12505,
title = {Demonstrating Agile Flight from Pixels without State Estimation},
author = {Ismail Geles and Leonard Bauersfeld and Angel Romero and Jiaxu Xing and Davide Scaramuzza},
journal= {arXiv preprint arXiv:2406.12505},
year = {2024}
}