中文

加速视频超分辨率模型训练

计算机视觉与模式识别 2022-05-18 v2 人工智能 多媒体

摘要

尽管卷积神经网络(CNN)近期在视频超分辨率(VSR)中展现出高质量重建,高效训练有竞争力的VSR模型仍具挑战。其耗时通常比训练对应的图像模型高一个数量级,导致研究周期漫长。现有VSR方法通常从头到尾以固定的空间与时间尺寸训练模型。这些固定尺寸通常设为较大值以获良好性能,致使训练缓慢。然而,此种刚性训练策略对VSR是否必要?本工作中,我们表明可逐步以由小到大空间/时间尺寸训练视频模型,即易到难方式。具体而言,整体训练分为若干阶段,较早阶段具有较小的训练空间形状。各阶段内,时间尺寸由短到长变化而空间尺寸保持不变。因多数计算在较小空间与较短时间形状上执行,该多网格训练策略加速了训练。为借助GPU并行进一步加速,我们还研究了不损失精度的大最小批次训练。大量实验表明,我们的方法能为多种VSR模型大幅加速训练(挂钟训练时间最高达6.2×6.2\times加速)且不降低性能。代码见 https://github.com/TencentARC/Efficient-VSR-Training。

关键词

引用

@article{arxiv.2205.05069,
  title  = {Accelerating the Training of Video Super-Resolution Models},
  author = {Lijian Lin and Xintao Wang and Zhongang Qi and Ying Shan},
  journal= {arXiv preprint arXiv:2205.05069},
  year   = {2022}
}

备注

The code is available at https://github.com/TencentARC/Efficient-VSR-Training