中文

基于几何引导的 3D 视觉令牌裁剪用于视频语言模型

计算机视觉与模式识别 2026-04-21 v1

摘要

多模态大语言模型在 2D 视觉任务中展现出惊人的能力,推动其向 3D 场景理解拓展。最近的研究将 3D 场景表示为由深度和相机位姿信息构成的 3D 空间视频序列,使预训练的视频语言模型能够进行 3D 推理。然而,空间视频中视觉令牌的数量大,成为高效推理和上下文管理的主要瓶颈。现有裁剪方法忽略了空间视频的视角一致性以及剩余令牌的空间多样性,无法有效消除帧间冗余且保全场景完整性。本文提出 Geo3DPruner—a 几何引导的 3D 视觉令牌裁剪框架。Geo3DPruner 通过几何感知全局注意力建模跨帧相关性,然后进行两阶段裁剪。内部体素阶段在每个体素内选择代表性多视角特征,外部体素阶段通过选择全局分布的体素子集来保持空间多样性。在多个 3D 场景理解基准测试上进行的大量实验表明,Geo3DPruner 在裁剪 90% 视觉令牌的同时,保留了超过 90% 的原始性能,显著优于现有的文本引导和视觉引导裁剪方法。

关键词

引用

@article{arxiv.2604.18260,
  title  = {Geometry-Guided 3D Visual Token Pruning for Video-Language Models},
  author = {Han Li and Zehao Huang and Jiahui Fu and Naiyan Wang and Si Liu},
  journal= {arXiv preprint arXiv:2604.18260},
  year   = {2026}
}

备注

Accepted by CVPR 2026