加速视频超分辨率模型训练
计算机视觉与模式识别
2022-05-18 v2 人工智能
多媒体
摘要
尽管卷积神经网络(CNN)近期在视频超分辨率(VSR)中展现出高质量重建,高效训练有竞争力的VSR模型仍具挑战。其耗时通常比训练对应的图像模型高一个数量级,导致研究周期漫长。现有VSR方法通常从头到尾以固定的空间与时间尺寸训练模型。这些固定尺寸通常设为较大值以获良好性能,致使训练缓慢。然而,此种刚性训练策略对VSR是否必要?本工作中,我们表明可逐步以由小到大空间/时间尺寸训练视频模型,即易到难方式。具体而言,整体训练分为若干阶段,较早阶段具有较小的训练空间形状。各阶段内,时间尺寸由短到长变化而空间尺寸保持不变。因多数计算在较小空间与较短时间形状上执行,该多网格训练策略加速了训练。为借助GPU并行进一步加速,我们还研究了不损失精度的大最小批次训练。大量实验表明,我们的方法能为多种VSR模型大幅加速训练(挂钟训练时间最高达加速)且不降低性能。代码见 https://github.com/TencentARC/Efficient-VSR-Training。
引用
@article{arxiv.2205.05069,
title = {Accelerating the Training of Video Super-Resolution Models},
author = {Lijian Lin and Xintao Wang and Zhongang Qi and Ying Shan},
journal= {arXiv preprint arXiv:2205.05069},
year = {2022}
}
备注
The code is available at https://github.com/TencentARC/Efficient-VSR-Training