UAV-Track VLA:基于视觉语言动作模型的无人机嵌入式跟踪
计算机视觉与模式识别
2026-04-13 v2 机器人学
摘要
嵌入式视觉跟踪是无人机执行复杂现实任务的关键技术。在具有复杂语义需求的动态城市场景中,视觉语言动作(Vision-Language-Action,VLA)模型因其跨模态融合和连续动作生成能力而显示出巨大的潜力。为对此类环境下的多模态跟踪进行基准测试,我们构建了一个专门的评估基准和一个大规模数据集,包含超过89万帧、176个任务和85种多样化目标。此外,为解决现有VLA模型中时间特征冗余以及缺乏空间几何先验的问题,我们提出了改进型VLA跟踪模型UAV-Track VLA。基于架构,该模型引入时间压缩网络高效捕获帧间动态。此外,设计由空间感知辅助 grounding 头和流匹配动作专家组成的并行双分支解码器,以解耦跨模态特征并生成细粒度连续动作。系统实验在CARLA模拟器中验证了我们方法的卓越端到端性能。值得注意的是,在具有挑战性的长距离行人跟踪任务中,UAV-Track VLA实现了61.76\%的成功率和269.65的平均跟踪帧数,显著优于现有基线。此外,它在未见环境中表现出稳健的零样本泛化能力,并将单步推理延迟降低33.4\%(至0.0571s),相较于原始,实现了高度有效、实时的无人机控制。数据样本和演示视频可在:https://github.com/Hub-Tian/UAV-Track_VLA访问。
引用
@article{arxiv.2604.02241,
title = {UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models},
author = {Qiyao Zhang and Shuhua Zheng and Jianli Sun and Chengxiang Li and Xianke Wu and Zihan Song and Zhiyong Cui and Yisheng Lv and Yonglin Tian},
journal= {arXiv preprint arXiv:2604.02241},
year = {2026}
}