中文

LiteVLA-H:面向航空导控与语义感知的双速视觉语言动作推理

计算机视觉与模式识别 2026-05-12 v2

摘要

视觉语言动作(VLA)模型在操控任务中展现出强大的语义对齐与任务泛化能力,但航空部署受限于无人机对低延迟闭环指导的需求,以及严格的 onboard 计算与通信约束。我们提出LiteVLA-H,这是一个2560万参数的VLA系统,专为NVIDIA Jetson AGX Orin上的双速运行设计:快速外环指导模式用于短动作token输出,慢速语义模式用于场景理解、危险描述及操作员语音叙述。中心实证发现,在紧凑型边缘环境中,端到端延迟主要来自多模态预填充,而非解码少量额外token的边际成本。这激励我们构建调度器,在同一嵌入平台上以50.65毫秒(19.74Hz)发出响应动作token,同时支持句子级语义输出,延迟为149.90--164.57毫秒(6.08--6.67Hz)。为避免模型退化描述能力,我们采用知识保留微调配方,混合响应飞行数据、航空语义数据及通用描述/VQA监督。除报告当前延迟测量外,我们将系统与最新SOTA架构(如AnywhereVLA、FutureVLA、ReMem-VLA)对比,显示在部署条件下,所提方法的动作分支实现了更高的边缘推理速率,同时保持周期性语义感知。

关键词

引用

@article{arxiv.2605.00884,
  title  = {LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception},
  author = {Justin williams and Kishor Datta Gupta and Roy George and Mrinmoy Sarkar},
  journal= {arXiv preprint arXiv:2605.00884},
  year   = {2026}
}