HIRI-ViT:面向高分辨率输入的 Vision Transformer 扩展
计算机视觉与模式识别
2024-03-19 v1 多媒体
摘要
Vision Transformer (ViT) 和卷积神经网络 (CNN) 的混合深度模型已成为视觉任务中一类强大的骨干网络。扩大此类混合骨干网络的输入分辨率自然能增强模型容量,但不可避免地会承受呈二次方增长的高昂计算成本。相反,我们提出了一种具有高分辨率输入的新型混合骨干网络(即 HIRI-ViT),它将流行的四阶段 ViT 升级为专为高分辨率输入定制的五阶段 ViT。HIRI-ViT 建立在将典型 CNN 操作以高效的方式分解为两个并行 CNN 分支的开创性思想之上。一个高分辨率分支直接以主要的高分辨率特征作为输入,但使用较少的卷积操作。另一个低分辨率分支首先执行下采样,然后在此类低分辨率特征上利用更多的卷积操作。在识别任务 (ImageNet-1K 数据集) 和密集预测任务 (COCO 和 ADE20K 数据集) 上的实验证明了 HIRI-ViT 的优越性。更值得注意的是,在可比的计算成本 (5.0 GFLOPs) 下,HIRI-ViT 在 448448 输入的 ImageNet 上实现了迄今为止最佳的 84.3% Top-1 准确率,相较于 224224 输入下 iFormer-S 的 83.4% 绝对提升了 0.9%。
引用
@article{arxiv.2403.11999,
title = {HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs},
author = {Ting Yao and Yehao Li and Yingwei Pan and Tao Mei},
journal= {arXiv preprint arXiv:2403.11999},
year = {2024}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)