重访用于视频识别的 3D ResNet
计算机视觉与模式识别
2021-09-07 v1 机器学习
图像与视频处理
摘要
Bello 的近期工作表明,对于视觉识别而言,训练与缩放策略可能比模型架构更为重要。本短札研究了视频识别模型的有效训练与缩放策略。我们提出了一种针对 3D ResNet 的简单缩放策略,结合改进的训练策略与微小的架构改动。所得模型称为 3D ResNet-RS,在无预训练情况下于 Kinetics-400 取得 81.0、于 Kinetics-600 取得 83.8 的竞争性性能。当在大型 Web Video Text 数据集上预训练时,我们的最佳模型在 Kinetics-400 与 Kinetics-600 上分别达到 83.5 与 84.3。所提缩放规则进一步在使用对比学习的自监督设置中进行了评估,展现出改进的性能。代码见:https://github.com/tensorflow/models/tree/master/official。
引用
@article{arxiv.2109.01696,
title = {Revisiting 3D ResNets for Video Recognition},
author = {Xianzhi Du and Yeqing Li and Yin Cui and Rui Qian and Jing Li and Irwan Bello},
journal= {arXiv preprint arXiv:2109.01696},
year = {2021}
}
备注
6 pages