中文

重新审视视觉-语言-动作模型中的参数冗余:从 VLM 到 VLA 适配的见解

机器人学 2026-06-30 v1

摘要

视觉-语言-动作(VLA)模型通过整合预训练视觉-语言模型(VLM)的强大表示,在具身智能方面取得了显著进展。然而,VLA 庞大的参数量带来了沉重的计算负担,并且这些模型对参数剪枝表现出极度敏感性。当前的范式通常将由此产生的性能下降视为不可避免,依赖微调或低秩校正来恢复效能。我们质疑这一惯例,探究如果 VLA 剪枝需要性能恢复才能有效,那么被移除的参数是否真正冗余,或者这种范式是否掩盖了对关键参数的不加区分的剪枝。我们通过 VLM 到 VLA 适配的视角重新审视参数冗余,首先量化适配过程中参数发散的空间分布,以揭示不同模块间的结构化模式。随后,我们引入受控剪枝作为诊断探针:通过比较在没有任何微调的情况下移除不同参数子集对 VLA 性能的直接影响,我们建立了适配诱导的发散信号与功能贡献之间的因果关系。基于发现的模块异质性,我们设计了一种多模块联合剪枝方案。在 LIBERO 基准上的评估表明,我们的方法将 OpenVLA 和 π0.5\pi_{0.5} 的参数减少了 12%--30%,同时在没有任何剪枝后恢复的情况下保持了约 90% 的原始性能。相比之下,现有的参数剪枝标准在相同的无恢复约束下评估时会导致性能完全崩溃。我们的研究揭示了 VLA 适配中的参数演化机制,并为在资源受限环境中部署高效、鲁棒的机器人策略提供了新途径。

关键词

引用

@article{arxiv.2606.31382,
  title  = {Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation},
  author = {Fengnian Zhang and Tao Huang and Siyu Xu and Zhong Jin and Chang Xu},
  journal= {arXiv preprint arXiv:2606.31382},
  year   = {2026}
}

备注

22 pages, 3 figures, ECCV 2026 Conference