SVT:用于高效视频理解的超令牌视频Transformer
计算机视觉与模式识别
2023-04-25 v2
摘要
无论是从头到尾以固定分辨率处理视频,还是采用池化与下采样策略,现有的视频Transformer都在整个网络中处理全部视频内容,而未对大量冗余信息作特殊处理。本文提出一种超令牌视频Transformer(SVT),其引入语义池化模块(SPM),基于语义沿视觉Transformer的深度聚合潜在表示,从而减少视频输入中固有的冗余。定性结果表明,我们的方法能够通过合并语义相似的潜在表示有效降低冗余,进而提升下游任务中显著信息的占比。定量上,在Kinectics和Something-Something-V2基准上,我们的方法在显著提升ViT和MViT性能的同时大幅降低了计算量。更具体地,借助我们的SPM,在Kinectics-400基准上,我们将MAE预训练的ViT-B和ViT-L的准确率分别提升了1.5%(GFLOPs减少33%)和0.2%(FLOPs减少55%);在Kinectics-400和Something-Something-V2上,我们将MViTv2-B的准确率分别提升了0.2%和0.3%,同时GFLOPs均减少22%。
引用
@article{arxiv.2304.00325,
title = {SVT: Supertoken Video Transformer for Efficient Video Understanding},
author = {Chenbin Pan and Rui Hou and Hanchao Yu and Qifan Wang and Senem Velipasalar and Madian Khabsa},
journal= {arXiv preprint arXiv:2304.00325},
year = {2023}
}