中文

基于CNN的视频时空推理比较分析

计算机视觉与模式识别 2021-01-12 v2 图像与视频处理

摘要

理解视频流中的动作和手势需要对来自不同时间点的空间内容进行时间推理,即时空(ST)建模。在这篇综述论文中,我们对用于动作和手势识别任务的不同ST建模技术进行了比较分析。由于卷积神经网络(CNNs)已被证明是静态图像有效的特征提取工具,我们将ST建模技术应用于由CNN提取的不同时间点的静态图像特征上。所有技术均与CNN特征提取部分一起端到端训练,并在两个公开基准上评估:Jester和Something-Something数据集。Jester数据集包含各种动态和静态手势,而Something-Something数据集包含人-物交互动作。这两个基准的共同特征是所设计的架构需要捕获视频的完整时间内容以正确分类动作/手势。与预期相反,实验结果表明,基于循环神经网络(RNN)的ST建模技术取得了劣于其他技术(如全卷积架构)的结果。本工作的代码和预训练模型已公开可用。

关键词

引用

@article{arxiv.1909.05165,
  title  = {Comparative Analysis of CNN-based Spatiotemporal Reasoning in Videos},
  author = {Okan Köpüklü and Fabian Herzog and Gerhard Rigoll},
  journal= {arXiv preprint arXiv:1909.05165},
  year   = {2021}
}