中文

视频 Transformer:综述

计算机视觉与模式识别 2023-02-14 v3

摘要

Transformer 模型在处理长程交互方面表现出巨大成功,使其成为建模视频的一种有前景的工具。然而,它们缺乏归纳偏置,且随输入长度呈二次方扩展。当处理由时间维度引入的高维性时,这些局限进一步加剧。尽管已有综述分析了 Transformer 在视觉领域的进展,但无一聚焦于对视频专用设计的深入分析。在本综述中,我们分析利用 Transformer 建模视频的工作的主要贡献与趋势。具体而言,我们首先深入探讨视频在输入层面是如何被处理的。然后,我们研究为更高效地处理视频、减少冗余、重新引入有用归纳偏置以及捕捉长期时间动态而进行的架构改动。此外,我们概述不同的训练机制并探讨针对视频的有效自监督学习策略。最后,我们在 Video Transformer 最常用的基准(即动作分类)上进行性能比较,发现它们即使在计算复杂度更低的情况下也优于 3D ConvNets。

关键词

引用

@article{arxiv.2201.05991,
  title  = {Video Transformers: A Survey},
  author = {Javier Selva and Anders S. Johansen and Sergio Escalera and Kamal Nasrollahi and Thomas B. Moeslund and Albert Clapés},
  journal= {arXiv preprint arXiv:2201.05991},
  year   = {2023}
}