中文

TDViT:用于密集视频任务的时序膨胀视频 Transformer

计算机视觉与模式识别 2024-02-15 v1

摘要

深度视频模型(例如 3D CNN 或视频 Transformer)在稀疏视频任务(即每个视频预测一个结果)上取得了令人瞩目的性能。然而,当将现有的深度视频模型应用于密集视频任务(即每帧预测一个结果)时,挑战随之而来。具体而言,这些模型部署成本高昂,在处理冗余帧时效果较差,且难以捕捉长程时序相关性。为克服这些问题,我们提出了一种时序膨胀视频 Transformer(TDViT),其由精心设计的时序膨胀 Transformer 块(TDTB)组成。TDTB 能够高效提取时空表示,并有效缓解时序冗余的负面影响。此外,通过使用分层 TDTB,我们的方法获得了指数级扩展的时序感受野,从而能够建模长程动态。我们在两个不同的密集视频基准上进行了广泛实验,即用于视频目标检测的 ImageNet VID 和用于视频实例分割的 YouTube VIS。优异的实验结果证明了我们方法在效率、有效性和兼容性方面的优越性。代码地址:https://github.com/guanxiongsun/vfe.pytorch。

关键词

引用

@article{arxiv.2402.09257,
  title  = {TDViT: Temporal Dilated Video Transformer for Dense Video Tasks},
  author = {Guanxiong Sun and Yang Hua and Guosheng Hu and Neil Robertson},
  journal= {arXiv preprint arXiv:2402.09257},
  year   = {2024}
}