RaceVLA:基于 VLA 的类人行为竞速无人机导航
机器人学
2025-03-05 v1 人工智能
摘要
RaceVLA 提出了一种自主竞速无人机导航的创新方法,通过利用视觉-语言-动作(VLA)来模拟类人行为。本研究探索了先进算法的集成,使无人机能够根据实时环境反馈调整其导航策略,模仿人类飞行员的决策过程。该模型在收集的竞速无人机数据集上进行了微调,尽管竞速无人机环境复杂,但仍展现出强大的泛化能力。受益于动态相机和简化的运动任务,RaceVLA 在运动(75.0 vs 60.0)和语义泛化(45.5 vs 36.3)上优于 OpenVLA。然而,由于在物体大小变化的动态环境中机动的挑战,视觉(79.6 vs 87.0)和物理泛化(50.0 vs 76.7)略有下降。RaceVLA 在所有轴向上也优于 RT-2——视觉(79.6 vs 52.0)、运动(75.0 vs 55.0)、物理(50.0 vs 26.7)和语义(45.5 vs 38.8),证明了其在复杂环境中进行实时调整的鲁棒性。实验显示平均速度为 1.04 m/s,最大速度为 2.02 m/s,且机动性一致,证明了 RaceVLA 有效处理高速场景的能力。这些发现突显了 RaceVLA 在竞技竞速环境中实现高性能导航的潜力。RaceVLA 代码库、预训练权重和数据集可在以下网址获取:https://racevla.github.io/
引用
@article{arxiv.2503.02572,
title = {RaceVLA: VLA-based Racing Drone Navigation with Human-like Behaviour},
author = {Valerii Serpiva and Artem Lykov and Artyom Myshlyaev and Muhammad Haris Khan and Ali Alridha Abdulkarim and Oleg Sautenkov and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2503.02572},
year = {2025}
}
备注
6 pages, 6 figures. Submitted to IROS 2025