中文

视频动作识别模型的大规模鲁棒性分析

计算机视觉与模式识别 2023-04-10 v2 图像与视频处理

摘要

近年来视频动作识别取得了巨大进展。已有若干基于卷积神经网络(CNN)的模型以及一些近期的基于 transformer 的方法在现有基准上提供顶尖性能。本工作中,我们对这些现有视频动作识别模型进行大规模鲁棒性分析。我们关注针对真实世界分布偏移扰动的鲁棒性,而非对抗扰动。我们提出四个不同的基准数据集 HMDB51-P、UCF101-P、Kinetics400-P 和 SSv2-P 来进行该分析。我们研究了六个最先进的动作识别模型对 90 种不同扰动的鲁棒性。研究揭示了若干有趣发现:1)基于 transformer 的模型相比基于 CNN 的模型始终更具鲁棒性;2)预训练对 transformer 模型的鲁棒性提升多于 CNN 模型;3)所有被研究模型对所有数据集除 SSv2 外均对时间扰动鲁棒,表明时间信息对动作识别的重要性因数据集和活动而异。接下来,我们研究增强在数据鲁棒性中的作用,并给出一个真实世界数据集 UCF101-DS(含真实分布偏移)以进一步验证部分发现。我们相信本研究将作为未来鲁棒视频动作识别研究的基准。

关键词

引用

@article{arxiv.2207.01398,
  title  = {Large-scale Robustness Analysis of Video Action Recognition Models},
  author = {Madeline Chantry Schiappa and Naman Biyani and Prudvi Kamtam and Shruti Vyas and Hamid Palangi and Vibhav Vineet and Yogesh Rawat},
  journal= {arXiv preprint arXiv:2207.01398},
  year   = {2023}
}

备注

Accepted in 2023 Conference on Computer Vision and Pattern Recognition (CVPR)