中文

Mix & Match:以混合图像尺寸训练卷积网络以提升精度、速度与尺度鲁棒性

计算机视觉与模式识别 2019-08-27 v1 机器学习 机器学习

摘要

卷积神经网络(CNNs)通常使用为给定模型预先确定的固定空间图像尺寸进行训练。尽管在指定尺寸的图像上训练,但众所周知 CNNs 可通过调整中间特征图的大小,在测试时评估多种图像尺寸。本工作中,我们描述并评估了一种在训练时混合多种图像尺寸的新型混合尺寸训练机制。我们证明,使用我们的方法训练的模型对图像尺寸变化更具鲁棒性,即便在小图像上也能良好泛化。这使得在测试时使用更小图像实现更快推理。例如,我们使用图像尺寸 160 的 ResNet50 取得了 76.43% 的 top-1 准确率,与计算量减半的基线模型准确率相当。此外,对于测试时使用的给定图像尺寸,我们表明该方法可用于加速训练或提升最终测试准确率。例如,我们能够以 288 空间尺寸评估的模型达到 79.27% 的准确率,相对基线提升 14%。

关键词

引用

@article{arxiv.1908.08986,
  title  = {Mix & Match: training convnets with mixed image sizes for improved accuracy, speed and scale resiliency},
  author = {Elad Hoffer and Berry Weinstein and Itay Hubara and Tal Ben-Nun and Torsten Hoefler and Daniel Soudry},
  journal= {arXiv preprint arXiv:1908.08986},
  year   = {2019}
}