Video Mobile-Former:基于高效全局时空建模的视频识别
计算机视觉与模式识别
2022-08-26 v1
摘要
基于 Transformer 的模型在主要视频识别基准上取得了最佳性能。得益于自注意力机制,这些模型相比基于 CNN 的模型展现出更强的长程依赖建模能力。然而,自注意力在海量 token 之上具有二次复杂度,由此带来的巨大计算开销限制了现有视频 Transformer 在移动设备等资源受限应用中的使用。本文我们将 Mobile-Former 扩展为 Video Mobile-Former,将视频架构解耦为轻量级 3D-CNNs(用于局部上下文建模)与 Transformer 模块(用于全局交互建模),二者以并行方式工作。为避免视频中大量局部 patch 之间计算自注意力所带来的显著计算成本,我们提出在 Transformer 中对整个视频仅使用极少全局 token(如 6 个),通过交叉注意力机制与 3D-CNNs 交换信息。通过高效的全局时空建模,Video Mobile-Former 显著提升了替代轻量级基线的视频识别性能,并在 500M 到 6G 总 FLOPs 的低 FLOP 区间内于多种视频识别任务上优于其他高效基于 CNN 的模型。值得注意的是,Video Mobile-Former 是首个将计算预算限制在 1G FLOPs 以内的基于 Transformer 的视频模型。
引用
@article{arxiv.2208.12257,
title = {Video Mobile-Former: Video Recognition with Efficient Global Spatial-temporal Modeling},
author = {Rui Wang and Zuxuan Wu and Dongdong Chen and Yinpeng Chen and Xiyang Dai and Mengchen Liu and Luowei Zhou and Lu Yuan and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2208.12257},
year = {2022}
}