中文

视频补丁修剪:通过早期token降低实现视频实例分割的高效方法

计算机视觉与模式识别 2026-04-02 v1

摘要

Vision Transformer(ViT)在多个基准测试中显示出领先的性能,但其高计算成本阻碍了实际部署。补丁修剪可实现显著的节省,但现有方法仅将token降低限制在较深的层次,留下了早期阶段的压缩未被探索。这限制了其在整体效率上的潜能。本文提出了一种新颖的视频补丁修剪框架(VPP),集成时间先验知识以实现早期ViT层次上的高效稀疏化。我们的方法灵感来自观察:来自较深层次提取的特征 exhibits strong 前景选择性。因此,我们提出了一个全可微模块,用于时间映射以准确选择早期网络阶段中最相关的补丁。值得注意的是,所提方法使密集预测任务的补丁降低率可达60%,超越传统图像基础补丁修剪(通常仅实现约30%的稀疏化)。VPP在高稀疏 regime中大显身手,即使补丁使用率降至55%以下,也能保持显著性能。具体而言,在YouTube-VIS 2021数据集上,最大性能下降仅为0.6%。

关键词

引用

@article{arxiv.2604.00827,
  title  = {Video Patch Pruning: Efficient Video Instance Segmentation via Early Token Reduction},
  author = {Patrick Glandorf and Thomas Norrenbrock and Bodo Rosenhahn},
  journal= {arXiv preprint arXiv:2604.00827},
  year   = {2026}
}

备注

CVPR'26 Workshops