中文

盯球不放:视频Transformer中的轨迹注意力

计算机视觉与模式识别 2021-10-26 v2

摘要

在视频Transformer中,时间维度通常被视为与两个空间维度相同。然而,在物体或相机可能运动的场景中,在帧 tt 中某位置成像的物理点,可能与帧 t+kt+k 中该位置所呈现的内容完全无关。这些时间对应关系应被建模以促进对动态场景的学习。为此,我们提出一种用于视频Transformer的新即插即用模块——轨迹注意力(trajectory attention)——它沿隐式确定的运动路径聚合信息。我们还提出了一种新方法来解决计算和内存对输入规模的二次依赖,这对于高分辨率或长视频尤为重要。尽管这些思想在多种设置中有用,我们将其应用于视频动作识别这一特定任务,采用Transformer模型,并在Kinetics、Something--Something V2和Epic-Kitchens数据集上取得了最先进的结果。代码和模型见:https://github.com/facebookresearch/Motionformer

关键词

引用

@article{arxiv.2106.05392,
  title  = {Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers},
  author = {Mandela Patrick and Dylan Campbell and Yuki M. Asano and Ishan Misra and Florian Metze and Christoph Feichtenhofer and Andrea Vedaldi and João F. Henriques},
  journal= {arXiv preprint arXiv:2106.05392},
  year   = {2021}
}

备注

NeurIPS 2021 (Oral). Project page: https://facebookresearch.github.io/Motionformer