中文

超大规模数据集能否进一步增强时空三维 CNN?

计算机视觉与模式识别 2020-04-13 v1

摘要

我们如何收集并利用视频数据集来进一步提升时空三维卷积神经网络(3D CNNs)?为积极回答视频识别中这一开放问题,我们利用若干大规模视频数据集与 3D CNNs 开展了探索性研究。在深度神经网络早期,就视频识别而言 2D CNNs 优于 3D CNNs。近期研究揭示,在大规模视频数据集上训练时 3D CNNs 可超越 2D CNNs。然而,我们严重依赖架构探索而非数据集考量。因此,本文为改进时空 3D CNNs 开展探索研究如下:(i)近期提出的大规模视频数据集有助于在视频分类精度方面提升时空 3D CNNs。我们揭示精心标注的数据集(如 Kinetics-700)能有效预训练用于视频分类任务的视频表示。(ii)我们确认了 #类别/#样本 与视频分类精度间的关系。结果表明,在数据集构建时,应首先固定 #类别,再增加视频数据集上的 #样本。(iii)为切实扩展视频数据集,我们简单拼接公开可用数据集,如 Kinetics-700 与 Moments in Time(MiT)数据集。相比 Kinetics-700 预训练,我们利用合并数据集进一步增强了时空 3D CNNs,在微调方面于 UCF-101、HMDB-51 和 ActivityNet 数据集上分别提升 +0.9、+3.4 和 +1.1。(iv)在识别架构方面,Kinetics-700 与合并数据集预训练模型借助残差网络(ResNet)将识别性能提升至 200 层,而 Kinetics-400 预训练模型无法成功优化 200 层架构。

关键词

引用

@article{arxiv.2004.04968,
  title  = {Would Mega-scale Datasets Further Enhance Spatiotemporal 3D CNNs?},
  author = {Hirokatsu Kataoka and Tenga Wakamiya and Kensho Hara and Yutaka Satoh},
  journal= {arXiv preprint arXiv:2004.04968},
  year   = {2020}
}

备注

Codes and pre-trained models are publicly available: https://github.com/kenshohara/3D-ResNets-PyTorch