DroneVLA:基于视觉-语言-动作模型的空中操作
机器人学
2026-01-22 v2 人工智能
摘要
随着空中平台从被动观察者演变为主动操作者,挑战转向了设计直观的界面,使非专业用户能够自然地指挥这些系统。本文介绍了一种新型自主空中操作系统概念,该系统能够解释高层自然语言命令,以取回物体并将其递送给人类用户。该系统旨在将基于Grounding DINO的MediaPipe和一个视觉-语言-动作(VLA)模型与一架配备单自由度夹爪和Intel RealSense RGB-D摄像头的定制无人机集成。VLA执行语义推理以解释用户提示的意图,并生成一个优先任务队列,用于抓取场景中的相关物体。Grounding DINO和动态A*规划算法用于导航并安全地重新放置物体。为确保在交接阶段实现安全自然的交互,系统采用了一个由MediaPipe驱动的人本控制器。该模块提供实时人体姿态估计,使无人机能够利用视觉伺服在用户正前方保持一个稳定、明确的位置,从而促进舒适的交接。我们通过现实世界中的定位和导航实验展示了该系统的有效性,其最大误差、平均欧几里得误差和均方根误差分别为0.164米、0.070米和0.084米,突显了VLA用于空中操作任务的可行性。
引用
@article{arxiv.2601.13809,
title = {DroneVLA: VLA based Aerial Manipulation},
author = {Fawad Mehboob and Monijesu James and Amir Habel and Jeffrin Sam and Miguel Altamirano Cabrera and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2601.13809},
year = {2026}
}
备注
This paper has been accepted for publication at LBR of HRI 2026 conference