ConViViT——一种结合卷积与分解自注意力的人类活动识别深度神经网络
计算机视觉与模式识别
2023-10-24 v1 机器学习
摘要
Transformer架构因其在泛化与捕获长程依赖方面的能力,在计算机视觉任务中获得了显著关注。这一特性使其非常适合从视频中生成时空令牌。另一方面,卷积是处理图像与视频的基本骨干,因为它们能在小的局部邻域内高效聚合信息,以创建描述视频空间维度的空间令牌。尽管基于CNN的架构与纯Transformer架构已被研究者广泛研究和使用,但这两种骨干的有效结合在活动识别领域尚未受到同等的关注。在本研究中,我们提出了一种新方法,在混合架构中利用CNN与Transformer的优势,使用RGB视频进行活动识别。具体而言,我们建议采用CNN网络通过生成有效分离执行活动的人体与背景的128通道视频来增强视频表示。随后,CNN模块的输出被送入Transformer以提取时空令牌,并用于分类。我们的架构在HMDB51、UCF101和ETRI-Activity3D上分别以90.05%、99.6%和95.09%取得了新的SOTA结果。
引用
@article{arxiv.2310.14416,
title = {ConViViT -- A Deep Neural Network Combining Convolutions and Factorized Self-Attention for Human Activity Recognition},
author = {Rachid Reda Dokkar and Faten Chaieb and Hassen Drira and Arezki Aberkane},
journal= {arXiv preprint arXiv:2310.14416},
year = {2023}
}