$\pi$ 但让它飞起来:面向空中操作的 VLA 模型物理导向迁移
机器人学
2026-03-27 v1
摘要
视觉语言-动作(VLA)模型,如 ,在多样化的固定基座操作臂上 demonstrating 了显著的泛化能力。然而,将这些基础模型迁移到空中平台仍是一个开放挑战,due to 固定基座机械臂的准静态动力学与飞行的非定向、高度动态本质之间的根本性不匹配。本文引入了 AirVLA 系统,探讨将操作预训练的 VLAs 迁移到空中抓取与放置任务。我们发现,虽然视觉表示能够有效迁移,但所需的特定控制动力学并未因此。为在不重新训练基础模型的情况下弥合这种“动力学差距”,我们引入了有效载荷感知引导机制,将有效载荷约束直接注入策略的流匹配采样过程中。为克服数据稀缺问题,我们进一步利用高斯溅射管道合成导航训练数据。我们通过 460 次实际实验进行评估,表明这种合成数据是性能提升的关键关键因素,使导航任务成功率达到 100%,而仅使用遥操作数据直接微调的最高成功率为 81%。我们的推理时 intervention——有效载荷感知引导——将实际的抓取与放置任务成功率从 23% 提升至 50%。最后,我们在一个长期组成任务上实现了 62% 的整体成功率。这些结果表明,经过适当数据增强和物理信息引导,预训练的操作 VLAs 可以迁移到空中操作和导航以及这些任务的组合。
引用
@article{arxiv.2603.25038,
title = {$\pi$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation},
author = {Johnathan Tucker and Denis Liu and Aiden Swann and Allen Ren and Javier Yu and Jiankai Sun and Brandon Kim and Lachlain McGranahan and Quan Vuong and Mac Schwager},
journal= {arXiv preprint arXiv:2603.25038},
year = {2026}
}