中文

Conviformers:卷积引导的视觉 Transformer

计算机视觉与模式识别 2022-08-31 v2 人工智能 机器学习

摘要

视觉 Transformer 如今是图像分类任务的事实标准选择。分类任务有细粒度与粗粒度两大类。在细粒度分类中,由于子类间高度相似,需发掘细微差异。当我们为节省内存与计算成本而下采样图像时,此类差异常丢失。本工作中,我们给出深入分析并描述开发基于标本馆标本的植物的细粒度分类系统的关键组件。我们广泛的实验分析表明,需要更好的增强技术,以及现代神经网络处理更高维图像的能力。我们还引入了一种称为 Conviformer 的卷积 Transformer 架构,其与流行的 Vision Transformer(ConViT)不同,可在不导致内存与计算成本爆炸的情况下处理更高分辨率图像。我们还引入了一种新颖改进的预处理技术 PreSizer,可在保持原始长宽比的同时更好地调整图像大小,这对自然植物分类至关重要。凭借简单而有效的方法,我们在 Herbarium 202x 与 iNaturalist 2019 数据集上取得了 SOTA。

关键词

引用

@article{arxiv.2208.08900,
  title  = {Conviformers: Convolutionally guided Vision Transformer},
  author = {Mohit Vaishnav and Thomas Fel and Ivań Felipe Rodríguez and Thomas Serre},
  journal= {arXiv preprint arXiv:2208.08900},
  year   = {2022}
}

备注

12 pages; 4 Figures; 8 Tables