中文

卷积神经网络的多尺度训练

机器学习 2026-03-03 v4

摘要

在高分辨率图像上训练卷积神经网络 (CNN) 常常受限于在最细网格上评估损失梯度的成本。为此,我们提出了多尺度梯度估计 (MGE),这是一种受多层蒙特卡洛采样启发的估计器,将最细网格上的期望梯度表示为在逐渐粗糙的网格上计算的梯度的 telescopic sum。通过分配更大的批量给较便宜的粗糙层,MGE 在保持与单尺度随机梯度估计相同方差的同时,减少每一次下采样中细网格卷积的数量为 4 的因子。我们进一步将 MGE 嵌入一个全多尺度训练算法,该算法先在粗糙网格上解决学习问题,然后“热启动”下一个更细的尺度,进一步将所需的细网格迭代次数减少一个数量级。针对图像去噪、去模糊、图像填充和超分辨率任务进行了广泛实验,使用 UNet、ResNet 和 ESPCN 作为 backbone。实验结果表明,全多尺度训练在计算成本上降低 4-16 倍且性能几乎不受影响。MGE 和全多尺度相结合,为在不牺牲准确性的前提下加速高分辨率数据的 CNN 训练提供了原则且无架构依赖的途径,它们可以与其他降低方差或学习率计划结合,以进一步提升可扩展性。

关键词

引用

@article{arxiv.2501.12739,
  title  = {Multiscale Training of Convolutional Neural Networks},
  author = {Shadab Ahamed and Niloufar Zakariaei and Eldad Haber and Moshe Eliasof},
  journal= {arXiv preprint arXiv:2501.12739},
  year   = {2026}
}

备注

25 pages, 10 figures, 8 tables