视频补丁修剪:通过早期token降低实现视频实例分割的高效方法
计算机视觉与模式识别
2026-04-02 v1
摘要
Vision Transformer(ViT)在多个基准测试中显示出领先的性能,但其高计算成本阻碍了实际部署。补丁修剪可实现显著的节省,但现有方法仅将token降低限制在较深的层次,留下了早期阶段的压缩未被探索。这限制了其在整体效率上的潜能。本文提出了一种新颖的视频补丁修剪框架(VPP),集成时间先验知识以实现早期ViT层次上的高效稀疏化。我们的方法灵感来自观察:来自较深层次提取的特征 exhibits strong 前景选择性。因此,我们提出了一个全可微模块,用于时间映射以准确选择早期网络阶段中最相关的补丁。值得注意的是,所提方法使密集预测任务的补丁降低率可达60%,超越传统图像基础补丁修剪(通常仅实现约30%的稀疏化)。VPP在高稀疏 regime中大显身手,即使补丁使用率降至55%以下,也能保持显著性能。具体而言,在YouTube-VIS 2021数据集上,最大性能下降仅为0.6%。
引用
@article{arxiv.2604.00827,
title = {Video Patch Pruning: Efficient Video Instance Segmentation via Early Token Reduction},
author = {Patrick Glandorf and Thomas Norrenbrock and Bodo Rosenhahn},
journal= {arXiv preprint arXiv:2604.00827},
year = {2026}
}
备注
CVPR'26 Workshops