中文

我的数据增强模型能跑多快?——通过 VLA-Perf 梳理 VLA 推理性能

机器人学 2026-02-23 v1

摘要

视觉-语言-动作(VLA)模型最近在 various 具身 AI 任务上展现出惊人的能力。尽管在实际机器人上部署 VLA 模型受到严格的实时推理约束,但由于模型架构与推理系统的大规模组合空间,VLA 的推理性能仍鲜为人知。本文提出一个根本性研究问题:未来的 VLA 模型和系统应如何设计才能支持实时推理?为解答此问,我们首先引入 VLA-Perf,一种可分析任意 VLA 模型与推理系统组合推理性能的分析性能模型。借助 VLA-Perf,我们进行了首次系统性的 VLA 推理性能全景研究。从模型设计角度,我们检视模型规模、模型架构选择、长上下文视频输入、异步推理以及双系统模型管道等因素对推理性能的影响。从部署角度,我们分析 VLA 推理应在何处执行——设备内、边缘服务器还是云端——以及硬件能力与网络性能如何共同决定端到端延迟。通过提炼 15 项关键经验,我们希望本工作能为未来 VLA 模型与推理系统的设计提供实用指导。

关键词

引用

@article{arxiv.2602.18397,
  title  = {How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf},
  author = {Wenqi Jiang and Jason Clemons and Karu Sankaralingam and Christos Kozyrakis},
  journal= {arXiv preprint arXiv:2602.18397},
  year   = {2026}
}