图像分类器能否胜任动作识别?
计算机视觉与模式识别
2022-04-27 v3
摘要
我们通过将视频识别问题视为图像识别任务,探索视频理解的新视角。我们的方法将输入视频帧重排为超图像,从而允许直接训练图像分类器以完成动作识别任务,方式与图像分类完全相同。凭借这一简单想法,我们表明仅基于transformer的图像分类器即可胜任动作识别。特别地,我们的方法在Kinetics400、Moments In Time、Something-Something V2 (SSV2)、Jester和Diving48等多个公开数据集上展示出相对于SOTA方法的强劲且有前景的性能。我们还使用计算机视觉中流行的ResNet图像分类器进一步验证我们的想法。在Kinetics400和SSV2上的结果与一些基于时空建模的最佳CNN方法相当。我们的源代码与模型见 https://github.com/IBM/sifar-pytorch。
引用
@article{arxiv.2106.14104,
title = {Can An Image Classifier Suffice For Action Recognition?},
author = {Quanfu Fan and Chun-Fu and Chen and Rameswar Panda},
journal= {arXiv preprint arXiv:2106.14104},
year = {2022}
}