中文

面向视觉-语言-动作模型的环境感知自适应剪枝与交错推理编排

人工智能 2026-02-03 v1

摘要

尽管视觉-语言-动作(VLA)模型在具身智能领前有着巨大的潜力,但其庞大的参数规模导致推理延迟 substantial,阻碍了实时操作。为此动机是对参数稀疏化。然而,随着环境在VLA执行期间的演变,最佳稀疏模式也会随之变化。静态剪枝缺乏适应环境动态所需的灵活性,而固定间隔动态层剪枝则受限于粗粒度和高额再训练开销。为弥合这一差距,我们提出EcoVLA,一个无训练、即插即用的自适应剪枝框架,支持与现有VLA加速方法的正交组合。EcoVLA包含两个组件:环境感知自适应剪枝(EAP)和交错推理编排(I2OI^2O)。EAP是一种轻量级自适应通道剪枝方法,融合了物理环境的时间一致性,以更新稀疏模式。I2OI^2O利用VLA推理中内在的FLOPs泡沫,並行调度剪枝方法,确保对延迟几乎没有影响。在多样化的VLA模型和基准测试上评估后,EcoVLA达到了最新的性能,最高可实现1.60倍加速,仅降低0.4%的成功率;在与token剪枝结合时,进一步实现2.18倍加速,仅降低0.5%的性能下降。我们进一步在真实机器人上验证了EcoVLA的有效性。

关键词

引用

@article{arxiv.2602.00780,
  title  = {Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models},
  author = {Yuting Huang and Leilei Ding and Zhipeng Tang and Zenghuan Zhu and Jiajun Deng and Xinrui Lin and Shuo Liu and Haojie Ren and Jianmin Ji and Yanyong Zhang},
  journal= {arXiv preprint arXiv:2602.00780},
  year   = {2026}
}

备注

12 pages, 7 figures