中文

重访用于视频识别的 3D ResNet

计算机视觉与模式识别 2021-09-07 v1 机器学习 图像与视频处理

摘要

Bello 的近期工作表明,对于视觉识别而言,训练与缩放策略可能比模型架构更为重要。本短札研究了视频识别模型的有效训练与缩放策略。我们提出了一种针对 3D ResNet 的简单缩放策略,结合改进的训练策略与微小的架构改动。所得模型称为 3D ResNet-RS,在无预训练情况下于 Kinetics-400 取得 81.0、于 Kinetics-600 取得 83.8 的竞争性性能。当在大型 Web Video Text 数据集上预训练时,我们的最佳模型在 Kinetics-400 与 Kinetics-600 上分别达到 83.5 与 84.3。所提缩放规则进一步在使用对比学习的自监督设置中进行了评估,展现出改进的性能。代码见:https://github.com/tensorflow/models/tree/master/official。

关键词

引用

@article{arxiv.2109.01696,
  title  = {Revisiting 3D ResNets for Video Recognition},
  author = {Xianzhi Du and Yeqing Li and Yin Cui and Rui Qian and Jing Li and Irwan Bello},
  journal= {arXiv preprint arXiv:2109.01696},
  year   = {2021}
}

备注

6 pages