目标区域视频 Transformer
计算机视觉与模式识别
2022-06-13 v3
摘要
近来,视频 Transformer 在视频理解中取得了巨大成功,超越了 CNN 的性能;然而现有的视频 Transformer 模型并未显式建模物体,尽管物体对于动作识别可能至关重要。在本工作中,我们提出目标区域视频 Transformer(ORViT),一种以物体为中心的方法,它通过一个直接融入物体表示的模块来扩展视频 Transformer 层。其核心思想是从早期层开始融合以物体为中心的表示,并将其传播到 Transformer 层中,从而影响整个网络的时空表示。我们的 ORViT 模块由两条物体级流组成:外观流和动态流。在外观流中,“目标区域注意力”模块在图像块和物体区域上应用自注意力。通过这种方式,视觉物体区域与均匀的图像块 token 交互,并以上下文物体信息丰富它们。我们通过一个独立的“物体动态模块”进一步建模物体轨迹交互,并展示如何整合这两条流。我们在四个任务和五个数据集上评估我们的模型:SomethingElse 上的组合与少样本动作识别,AVA 上的时空动作检测,以及 Something-Something V2、Diving48 和 Epic-Kitchen100 上的标准动作识别。我们在所有考虑的任务和数据集上均显示出强劲的性能提升,证明了将物体表示纳入 Transformer 架构的模型的价值。有关代码和预训练模型,请访问项目页面 \url{https://roeiherz.github.io/ORViT/}
引用
@article{arxiv.2110.06915,
title = {Object-Region Video Transformers},
author = {Roei Herzig and Elad Ben-Avraham and Karttikeya Mangalam and Amir Bar and Gal Chechik and Anna Rohrbach and Trevor Darrell and Amir Globerson},
journal= {arXiv preprint arXiv:2110.06915},
year = {2022}
}
备注
CVPR 2022