中文

LiteVLA-Edge:面向嵌入式机器人的量化设备级多模态控制

机器人学 2026-03-05 v1 人工智能

摘要

视觉-语言-动作 (VLA) 模型提供了感知、语言条件和动作生成的统一框架,但许多现有系统在计算需求和推理延迟方面难以部署到嵌入式机器人环境中。本文提出了 LiteVLA-Edge,一个面向 Jetson Orin 级硬件上完全设备端推理的 VLA 管道。我们的方法将 FP32 中的监督图像到动作微调与 post-training 4 位 GGUF 量化相结合,通过 \texttt{llama.cpp} 运行时实现 GPU 加速推理。在我们的部署配置下,LiteVLA-Edge 实现了 150.5 毫秒的平均端到端延迟(约 6.6 Hz),且完全在集成了 ROS~2 的感知-推理-动作管道中离线运行。我们并未引入新的策略目标,本文的贡献是为在嵌入式硬件上执行紧凑型多模态控制模型的实用系统路径,同时保持感知、推理和执行之间的模块化接口。这些结果确立了对响应式语言条件控制的时序可行性,为未来在机器人中对设备级 VLA 的任务级评估提供了可复现的基线。

关键词

引用

@article{arxiv.2603.03380,
  title  = {LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics},
  author = {Justin Williams and Kishor Datta Gupta and Roy George and Mrinmoy Sarkar},
  journal= {arXiv preprint arXiv:2603.03380},
  year   = {2026}
}