中文

从边缘到云端 GPU 的视觉语言动作模型跨平台扩展

人工智能 2026-01-27 v2 计算机视觉与模式识别 新兴技术 机器学习 机器人学

摘要

视觉语言动作 (Vision-Language-Action, VLA) 模型已成为机器人控制的强大通用策略,但其在不同模型架构和硬件平台上的性能扩展情况,以及随之而来的功耗预算,仍不为人所了解。本文评估了五种代表性 VLA 模型——涵盖最先进的基线模型和两种新提出的架构——针对边缘和数据中心 GPU 平台。使用 LIBERO 基准,我们测量准确率以及系统级指标,包括延迟、吞吐量和峰值内存使用情况,在不同的边缘功率约束和高性能数据中心 GPU 配置下。我们的结果识别出不同的扩展趋势:(1) 架构选择,如动作标记化和模型背板大小,强烈影响吞吐量和内存占用;(2) 受功率限制的边缘设备表现出非线性性能衰减,一些配置甚至能匹配或超过较旧的数据中心 GPU;(3) 在不显著牺牲准确率的情况下,可以实现高吞吐量变体。这些发现提供了在各种部署约束下选择和优化 VLA 的可操作性见解。我们的工作挑战了当前关于数据中心硬件在机器人推理中优越性的假设。

关键词

引用

@article{arxiv.2509.11480,
  title  = {Cross-Platform Scaling of Vision-Language-Action Models from Edge to Cloud GPUs},
  author = {Amir Taherin and Juyi Lin and Arash Akbari and Arman Akbari and Pu Zhao and Weiwei Chen and David Kaeli and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2509.11480},
  year   = {2026}
}

备注

To appear in the Asilomar Conference on Signals, Systems, and Computers 2025