中文

面向时空特征学习的 ConvNet 架构搜索

计算机视觉与模式识别 2017-08-18 v1

摘要

通过在 ImageNet 上预训练 ConvNets 来学习图像表示,已被证明在许多视觉理解任务中非常有效,包括目标检测、语义分割和图像描述。尽管任何图像表示都可以应用于视频帧,但专用的时空表示对于纳入仅基于外观的模型无法捕捉的运动模式仍然至关重要。本文提出了一种用于时空特征学习的经验性 ConvNet 架构搜索,最终得到一种深度三维(3D)残差 ConvNet。我们提出的架构在 Sports-1M、UCF101、HMDB51、THUMOS14 和 ASLAN 上以显著优势优于 C3D,同时推理速度提高 2 倍,模型大小缩小 2 倍,且具有更紧凑的表示。

关键词

引用

@article{arxiv.1708.05038,
  title  = {ConvNet Architecture Search for Spatiotemporal Feature Learning},
  author = {Du Tran and Jamie Ray and Zheng Shou and Shih-Fu Chang and Manohar Paluri},
  journal= {arXiv preprint arXiv:1708.05038},
  year   = {2017}
}