中文

基于语义感知时间累积的时空令牌剪枝

计算机视觉与模式识别 2023-08-10 v1

摘要

由于其令人印象深刻的性能,Transformer已成为计算机视觉领域的主要骨干网络。然而,不友好的计算成本阻碍了它们在视频识别领域的潜力。为优化速度-精度权衡,我们提出语义感知时间累积分数(STA)以整体剪枝时空令牌。STA分数考虑两个关键因素:时间冗余与语义重要性。前者通过聚合连续帧中令牌到令牌的相似性,基于某区域是新出现还是已见实体来刻画;后者则根据每个令牌对整体预测的贡献进行评估。因此,具有较高STA分数的令牌携带更多时间冗余及较低语义,从而被剪枝。基于STA分数,我们能够在无需引入任何额外参数或进一步重训练的情况下逐步剪枝令牌。我们直接将STA模块应用于现成的ViT和VideoSwin骨干网络,在Kinetics-400和Something-Something V2上的实证结果实现了超过30%的计算量缩减,且精度损失可忽略(约0.2%)。代码发布于 https://github.com/Mark12Ding/STA。

关键词

引用

@article{arxiv.2308.04549,
  title  = {Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation},
  author = {Shuangrui Ding and Peisen Zhao and Xiaopeng Zhang and Rui Qian and Hongkai Xiong and Qi Tian},
  journal= {arXiv preprint arXiv:2308.04549},
  year   = {2023}
}

备注

ICCV 2023 camera ready