视觉Transformer用于端到端基于视觉的四旋翼避障
机器人学
2025-04-03 v3 人工智能
图像与视频处理
摘要
我们展示了基于注意力的端到端方法在密集杂乱环境中进行高速基于视觉的四旋翼避障的能力,并与多种最先进的学习架构进行了比较。四旋翼无人机(UAV)在高速飞行时具有极强的机动性;然而,随着飞行速度的增加,传统的基于模型的导航方法(通过独立的感知、建图、规划和控制模块)会因传感器噪声增加、误差累积和处理延迟增加而失效。因此,基于学习的端到端视觉-控制网络在通过这些杂乱环境对这些快速机器人进行在线控制方面显示出巨大潜力。我们在高保真仿真中训练并比较了卷积、U-Net和循环架构与视觉Transformer(ViT)模型在深度图像到控制方面的表现,观察到ViT模型在四旋翼速度增加时以及在泛化到未见环境方面比其他模型更有效,而添加循环进一步提高了性能,同时在所有测试飞行速度下降低了四旋翼的能量消耗。我们在仿真和硬件中评估了高达7m/s速度下的性能。据我们所知,这是首个利用视觉Transformer进行端到端基于视觉的四旋翼控制的工作。
引用
@article{arxiv.2405.10391,
title = {Vision Transformers for End-to-End Vision-Based Quadrotor Obstacle Avoidance},
author = {Anish Bhattacharya and Nishanth Rao and Dhruv Parikh and Pratik Kunapuli and Yuwei Wu and Yuezhan Tao and Nikolai Matni and Vijay Kumar},
journal= {arXiv preprint arXiv:2405.10391},
year = {2025}
}
备注
11 pages, 18 figures, 3 tables (with supplementary)