中文

NanoVLA:面向纳米级通用机器人策略的解耦式视觉语言理解路由

机器人学 2025-10-30 v1

摘要

视觉语言-动作(VLA)模型通过将视觉语言模型(VLM)和动作解码器集成到统一架构中,显著推进了机器人操作。然而,其在资源受限的边缘设备(如移动机器人或嵌入式系统,如Jetson Orin Nano)上的部署仍具挑战,尤其是在功耗、延迟和计算资源至关重要的实际场景中。为此,我们引入Nano级视觉语言动作(NanoVLA),一系列轻量级VLA架构,实现最小资源下的高性能。核心创新包括:(1)视觉语言解耦,将传统的早期视觉和语言输入融合从VLM的早期阶段移至后期,既提升性能又可实现缓存,降低推理开销和延迟;(2)长短动作块分解,确保多步骤规划平滑连贯,同时不牺牲实时响应性;(3)动态路由,根据任务复杂度自适应分配轻量或重型 backbone,进一步优化推理效率。实验结果表明,NanoVLA在边缘设备上相较于先前的SOTA VLA模型,推理速度提升最高达52倍,参数减少98%,同时保持或超越其任务准确率和泛化能力。消融实验确认解耦策略保留了跨任务迁移能力,路由模块提升了成本-性能权衡,使NanoVLA能够在资源受限的硬件上实现实用、高精度的机器人操作。

关键词

引用

@article{arxiv.2510.25122,
  title  = {NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies},
  author = {Jiahong Chen and Jing Wang and Long Chen and Chuwei Cai and Jinghui Lu},
  journal= {arXiv preprint arXiv:2510.25122},
  year   = {2025}
}