中文

一种用于高效训练视频模型的多重网格方法

计算机视觉与模式识别 2020-06-11 v2

摘要

训练有竞争力的深度视频模型比训练其对应的图像模型慢一个数量级。缓慢的训练导致长的研究周期,阻碍了视频理解研究的进展。遵循训练图像模型的标准做法,视频模型训练假定固定的小批量形状:特定数量的片段、帧和空间尺寸。然而,什么是最优形状?高分辨率模型表现好但训练慢。低分辨率模型训练快但不准确。受数值优化中多重网格方法的启发,我们提出使用具有不同时空分辨率的可变小批量形状,并按调度变化。不同形状源于在多个采样网格上对训练数据重采样。通过在缩小其他维度时增大小批量大小和学习率来加速训练。我们凭经验证明了一个通用且鲁棒的多重网格调度,可在不同模型(I3D、non-local、SlowFast)、数据集(Kinetics、Something-Something、Charades)和训练设置(有或无预训练、128 GPU 或 1 GPU)下实现显著的即开即用训练加速且不损失精度。作为一个说明性例子,所提出的多重网格方法训练 ResNet-50 SlowFast 网络比基线训练方法快 4.5 倍(挂钟时间,相同硬件),同时在 Kinetics-400 上精度也更高(绝对提升 +0.8%)。代码已在线提供。

关键词

引用

@article{arxiv.1912.00998,
  title  = {A Multigrid Method for Efficiently Training Video Models},
  author = {Chao-Yuan Wu and Ross Girshick and Kaiming He and Christoph Feichtenhofer and Philipp Krähenbühl},
  journal= {arXiv preprint arXiv:1912.00998},
  year   = {2020}
}

备注

CVPR 2020