中文

为基于 CNN 的动作识别虚拟生成 IDT 描述符与 I3D 光流特征

计算机视觉与模式识别 2019-08-20 v2

摘要

在本文中,我们恢复了对老式手工设计视频表示在动作识别中的使用,并通过基于 CNN 的虚拟生成步骤为这些技术注入了新活力。除了使用 RGB 和光流帧之外,I3D 模型(以及其他模型)还通过将其输出与 Improved Dense Trajectory (IDT) 相结合而表现出色,IDT 提取的低级视频描述符通过 Bag-of-Words (BoW) 和 Fisher Vectors (FV) 进行编码。由于预处理、描述符提取、编码和参数调优,这种 CNN 与手工设计表示的融合非常耗时。因此,我们提出了一个端到端可训练的网络,其分支在训练阶段学习基于 IDT 的 BoW/FV 表示,并且易于与 I3D 模型集成。具体而言,每个分支提取最后一个 1D 卷积层之前的 I3D 特征图,并学习将这些图“翻译”为 BoW/FV 表示。因此,我们的模型可以在测试阶段虚拟生成并使用这种合成的 BoW/FV 表示。我们表明,甚至整个 I3D 光流分支的特征也可以被虚拟生成,从而简化了流程。我们的模型节省了 20-55 小时的计算量,并在四个公开可用的数据集上取得了 SOTA 结果。

关键词

引用

@article{arxiv.1906.05910,
  title  = {Hallucinating IDT Descriptors and I3D Optical Flow Features for Action Recognition with CNNs},
  author = {Lei Wang and Piotr Koniusz and Du Q. Huynh},
  journal= {arXiv preprint arXiv:1906.05910},
  year   = {2019}
}

备注

First two authors contributed equally. This paper is accepted by ICCV'19