中文

从图像到视频的Transformer动态压缩自适应

计算机视觉与模式识别 2024-08-15 v2

摘要

近年来,预训练视觉Transformer(ViT)在图像-文本匹配中的显著成功激发了从图像到视频自适应的研究兴趣。然而,目前大多数方法对每一帧都执行完整的前向传播,导致处理整个视频时计算开销很高。在本文中,我们提出了InTI,一种利用动态帧间令牌插值进行压缩式图像到视频自适应新方法。InTI旨在在不破坏令牌连贯时空结构的情况下,软性保留信息性令牌。具体来说,相邻帧内相同位置的每对令牌被线性聚合为一个新令牌,其中聚合权重由多尺度上下文感知网络生成。通过这种方式,相邻帧的信息可以以逐点方式自适应压缩,从而每次有效减少一半的处理帧数。重要的是,InTI可以无缝集成到现有的自适应方法中,无需额外复杂设计即可实现强性能。在Kinetics-400上,与朴素自适应相比,InTI达到了87.1的top-1准确率,同时GFLOPs显著降低了37.5%。当与额外的时间模块结合时,InTI实现了87.6的top-1准确率,GFLOPs降低了37%。在其他常见数据集上也验证了类似的结论。

关键词

引用

@article{arxiv.2408.06840,
  title  = {Dynamic and Compressive Adaptation of Transformers From Images to Videos},
  author = {Guozhen Zhang and Jingyu Liu and Shengming Cao and Xiaotong Zhao and Kevin Zhao and Kai Ma and Limin Wang},
  journal= {arXiv preprint arXiv:2408.06840},
  year   = {2024}
}