中文

UltraMNIST分类:一个用于训练CNN处理超大图像的基准

计算机视觉与模式识别 2022-06-28 v1

摘要

当前文献中的卷积神经网络(CNN)方法主要设计用于处理低分辨率图像。当应用于非常大尺寸的图像时,会出现与GPU内存、语义对应所需感受野过小以及需要融合多尺度特征相关的挑战。输入图像的分辨率可以降低,但这会严重损失关键信息。基于上述问题,我们引入了一个训练CNN处理超大图像的新研究问题,并提出了“UltraMNIST数据集”,一个简单但具代表性的该任务基准数据集。UltraMNIST使用流行的MNIST数字设计,并添加了额外复杂层级以很好地复现真实世界问题的挑战。我们给出该问题的两种变体:“UltraMNIST分类”和“预算感知UltraMNIST分类”。标准UltraMNIST分类基准旨在促进能充分利用最佳可用GPU资源的新型CNN训练方法的发展。预算感知变体旨在推动在受限GPU内存下工作的方法的发展。为开发有竞争力的解决方案,我们针对标准基准及其预算感知变体给出了若干基线模型。我们研究了降低分辨率对性能的影响,并给出了使用流行SOTA模型中预训练骨干网络的基线模型结果。最后,借助所提出的基准数据集与基线,我们希望为新一代高效且轻量资源处理大图像的CNN方法铺平道路。

关键词

引用

@article{arxiv.2206.12681,
  title  = {UltraMNIST Classification: A Benchmark to Train CNNs for Very Large Images},
  author = {Deepak K. Gupta and Udbhav Bamba and Abhishek Thakur and Akash Gupta and Suraj Sharan and Ertugrul Demir and Dilip K. Prasad},
  journal= {arXiv preprint arXiv:2206.12681},
  year   = {2022}
}