UniFormerV2:以视频 UniFormer 武装图像 ViT 的时空学习
计算机视觉与模式识别
2022-11-18 v1
摘要
学习有判别力的时空表征是视频理解的关键问题。近来,视觉Transformer(ViT)已展现出通过自注意力学习长时视频依赖的能力。遗憾的是,由于 token 间盲目的全局比较,它们在处理局部视频冗余时表现出局限性。UniFormer 已成功缓解该问题,其将卷积与自注意力统一为 transformer 格式中的关系聚合器。然而,该模型在视频上微调之前,必须进行繁琐复杂的图像预训练阶段,这阻碍了它的实际应用。相反,开源的 ViT 随时可用且以丰富的图像监督充分预训练。基于这些观察,我们提出一种通用范式,通过以高效的 UniFormer 设计武装预训练 ViT 来构建强大的视频网络系列。我们称此系列为 UniFormerV2,因为它继承了 UniFormer 块的简洁风格。但它包含全新的局部与全局关系聚合器,能够通过无缝整合 ViT 与 UniFormer 两者的优势来实现理想的精度-计算平衡。无需任何额外技巧,我们的 UniFormerV2 在 8 个流行视频基准上取得了最先进的识别性能,包括场景相关的 Kinetics-400/600/700 与 Moments in Time、时序相关的 Something-Something V1/V2、未裁剪的 ActivityNet 与 HACS。特别地,据我们所知,它是首个在 Kinetics-400 上达到 90% top-1 准确率的模型。代码将发布于 https://github.com/OpenGVLab/UniFormerV2。
引用
@article{arxiv.2211.09552,
title = {UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer},
author = {Kunchang Li and Yali Wang and Yinan He and Yizhuo Li and Yi Wang and Limin Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2211.09552},
year = {2022}
}
备注
24 pages, 4 figures, 20 tables