中文

重新审视ViT基稀疏多视角3D目标检测器的Token压缩技术

计算机视觉与模式识别 2026-04-17 v1

摘要

ViT基稀疏多视角3D目标检测器已取得显著的精度,但由于重型token处理仍 suffer from high inference latency。为加速这些模型,token压缩受到广泛探索。然而,我们的重新审视现有策略,如token剪枝、合并和patch尺寸扩大,揭示了这些方法往往丢弃信息丰富的背景线索、破坏上下文一致性并丢失细粒度语义,进而负面影响3D检测。为克服这些限制,我们提出SEPatch3D—a新型框架在保持关键语义信息的基础上动态调整patch尺寸。具体而言,我们设计时空感知的Patch Size Selection (SPSS),为场景中相邻物体所在的区域分配小patch以保留细节,为背景主导的场景分配大patch以减少计算成本。为进一步缓解潜在细节损失,Informative Patch Selection (IPS)选择具有信息性的patch进行特征细化,Cross-Granularity Feature Enhancement (CGFE)将细粒度细节注入所选粗粒度patch,从而丰富语义特征。在nuScenes和Argoverse 2验证集上的实验表明,SEPatch3D相较于StreamPETR基线实现了最高可达57%的推理速度加速,相较于最新方法ToC3D-faster提高了20%的效率,同时保持了可comparable的检测精度。代码已公开于https://github.com/Mingqj/SEPatch3D。

关键词

引用

@article{arxiv.2604.14563,
  title  = {Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors},
  author = {Mingqian Ji and Shanshan Zhang and Jian Yang},
  journal= {arXiv preprint arXiv:2604.14563},
  year   = {2026}
}

备注

Accepted by CVPR 2026