MM-ViT:用于压缩视频动作识别的多模态视频Transformer
计算机视觉与模式识别
2021-11-16 v2
摘要
本文提出一种纯基于Transformer的方法,称为多模态视频Transformer (MM-ViT),用于视频动作识别。不同于其他仅利用解码后RGB帧的方案,MM-ViT完全在压缩视频域中运行,并利用所有现成模态,即I帧、运动向量、残差和音频波形。为处理从多模态提取的大量时空令牌,我们开发了若干可扩展的模型变体,将自注意力在空间、时间和模态维度上分解。此外,为进一步探索丰富的模态间交互及其影响,我们开发并比较了三种可无缝集成到Transformer构建块中的跨模态注意力机制。在三个公开动作识别基准(UCF-101、Something-Something-v2、Kinetics-600)上的大量实验表明,MM-ViT在效率与精度上均优于SOTA视频Transformer,且在与计算密集的光流相结合的SOTA CNN对应模型相比时表现更优或相当。
引用
@article{arxiv.2108.09322,
title = {MM-ViT: Multi-Modal Video Transformer for Compressed Video Action Recognition},
author = {Jiawei Chen and Chiu Man Ho},
journal= {arXiv preprint arXiv:2108.09322},
year = {2021}
}
备注
Winter Conference on Applications of Computer Vision (WACV) 2022