中文

2D 还是 3D:哪一个主导了 VLA 模型中的显著性?——基于显著性感知的三阶段标记裁剪框架

多媒体 2026-04-21 v2 计算机视觉与模式识别 机器人学

摘要

视觉-语言-动作(VLA)模型已成为具身智能的主流。最近的 VLA 模型将输入模态从 2D 单模态扩展到 2D+3D 范式,形成多视觉模态 VLA(MVLA)模型。尽管实现了 improved 的空间感知,MVLA 面临更大的加速需求,这是由于模态扩展导致的输入标记数量增加所致。标记裁剪是一种针对 MVLA 模型的有效优化方法,但现有的标记裁剪方案是为 2D 单模态 VLA 模型设计的,忽略了 2D/3D 模态显著性差异。在本文中,我们遵循多模态数据在 MVLA 模型中的应用流程,开发了三阶段分析以捕捉 2D/3D 模态显著性的差异和动态。基于这些,我们提出了相应的三阶段标记裁剪框架,用于 MVLA 模型以实现最佳的 2D/3D 标记选择和高效裁剪。实验表明,我们的框架在保持最小精度损失的同时,可实现最高可达 2.55 倍的推理加速,仅需 5.8% 的开销。我们的代码即将发布。

关键词

引用

@article{arxiv.2604.09244,
  title  = {2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness},
  author = {Zihao Zheng and Sicheng Tian and Zhihao Mao and Lingyue Zhang and Chenyue Li and Ziyun Zhang and Hong Gao and Yuchen Huang and Yutong Xu and Guojie Luo and Xiang Chen},
  journal= {arXiv preprint arXiv:2604.09244},
  year   = {2026}
}