中文

修复训练-测试分辨率差异

计算机视觉与模式识别 2022-01-21 v4 机器学习

摘要

数据增强是训练用于图像分类的神经网络的关键。本文首先表明,现有的增强方式会导致分类器在训练与测试时看到的物体典型尺寸之间存在显著差异。我们通过实验验证,对于给定的目标测试分辨率,使用较低训练分辨率可在测试时获得更好的分类效果。随后我们提出一种简单而有效且高效的策略,用于在训练与测试分辨率不同时优化分类器性能。该策略仅涉及在测试分辨率下对网络进行计算代价低廉的微调。这使得使用小尺寸训练图像训练强分类器成为可能。例如,我们使用在 128x128 图像上训练的 ResNet-50 在 ImageNet 上获得 77.1% 的 top-1 准确率,使用在 224x224 图像上训练的模型获得 79.8%。此外,若使用额外训练数据,我们在 224x224 图像上训练的 ResNet-50 可获得 82.5%。反之,当训练一个在 940 百万公开图像上以 224x224 分辨率弱监督预训练、并进一步优化至测试分辨率 320x320 的 ResNeXt-101 32x48d 时,我们获得了 86.4% 的测试 top-1 准确率(top-5:98.0%)(单裁剪)。据我们所知,这是迄今为止最高的 ImageNet 单裁剪 top-1 与 top-5 准确率。

关键词

引用

@article{arxiv.1906.06423,
  title  = {Fixing the train-test resolution discrepancy},
  author = {Hugo Touvron and Andrea Vedaldi and Matthijs Douze and Hervé Jégou},
  journal= {arXiv preprint arXiv:1906.06423},
  year   = {2022}
}