Video BagNet:短时序感受野提升长时动作识别的鲁棒性
计算机视觉与模式识别
2023-08-23 v1
摘要
先前关于长时视频动作识别的工作依赖于具有大时序感受野(RF)的深度3D卷积模型。我们认为这些模型并非总是视频时序建模的最佳选择。大时序感受野使模型能够编码视频精确的子动作顺序,当测试视频具有不同子动作顺序时会导致性能下降。本文中,我们探究是否可通过缩小动作识别模型的时序感受野来提升其对子动作顺序的鲁棒性。为此,我们设计了Video BagNet,一种时序感受野大小限制为1、9、17或33帧的3D ResNet-50模型变体。我们在合成和真实世界视频数据集上分析Video BagNet,并实验比较具有不同时序感受野的模型。我们发现短时序感受野对子动作顺序变化具有鲁棒性,而较大时序感受野对子动作顺序敏感。
引用
@article{arxiv.2308.11249,
title = {Video BagNet: short temporal receptive fields increase robustness in long-term action recognition},
author = {Ombretta Strafforello and Xin Liu and Klamer Schutte and Jan van Gemert},
journal= {arXiv preprint arXiv:2308.11249},
year = {2023}
}