Patch n' Pack:NaViT,一种支持任意宽高比与分辨率的视觉Transformer
计算机视觉与模式识别
2023-07-13 v1 人工智能
机器学习
摘要
在计算机视觉模型处理前将图像缩放至固定分辨率这一普遍且已被证明次优的做法,至今尚未被成功挑战。然而,诸如 Vision Transformer (ViT) 之类的模型提供了基于序列的灵活建模,从而具有可变输入序列长度。我们利用这一特性提出 NaViT(Native Resolution ViT),其在训练时使用序列打包来处理任意分辨率和宽高比的输入。除灵活的模型使用外,我们展示了在大规模监督与对比图文预训练上改进的训练效率。NaViT 可高效迁移至图像与视频分类、目标检测和语义分割等标准任务,并在鲁棒性与公平性基准上取得改进结果。在推理时,输入分辨率的灵活性可用于平滑地权衡测试时成本与性能。我们认为 NaViT 标志着对大多数计算机视觉模型所使用的、由 CNN 设计的输入与建模流程的背离,并代表了 ViT 的一个有前景的方向。
引用
@article{arxiv.2307.06304,
title = {Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution},
author = {Mostafa Dehghani and Basil Mustafa and Josip Djolonga and Jonathan Heek and Matthias Minderer and Mathilde Caron and Andreas Steiner and Joan Puigcerver and Robert Geirhos and Ibrahim Alabdulmohsin and Avital Oliver and Piotr Padlewski and Alexey Gritsenko and Mario Lučić and Neil Houlsby},
journal= {arXiv preprint arXiv:2307.06304},
year = {2023}
}