中文

ViTAR:面向任意分辨率的视觉转换器

计算机视觉与模式识别 2024-03-29 v2

摘要

本文解决了视觉转换器(ViTs)在不同图像分辨率下受限可扩展性的重大挑战。通常情况下,ViTs在处理与训练期间未见到的分辨率时会出现性能下降。我们的工作引入了两种关键创新以解决此问题。首先,我们提出了一个用于动态分辨率调整的新模块,旨在以单一Transformer块实现高度高效的增量token集成。其次,我们在视觉转换器中引入了模糊位置编码,以在多个分辨率上提供一致的位置感知,从而防止对单一训练分辨率的过拟合。我们得到的模型ViTAR(Vision Transformer with Any Resolution)显示出惊人的适应性,在1120x1120分辨率下实现了83.3%的top-1准确率,在4032x4032分辨率下实现了80.4%的准确率,同时降低了计算成本。ViTAR在下游任务如实例和语义分割中也表现出强大的性能,并且可以轻松与像Masked AutoEncoder这样的自监督学习技术结合。我们的工作为增强ViTs的分辨率可扩展性提供了一种成本有效的解决方案,为更灵活和高效的高分辨率图像处理铺平了道路。

关键词

引用

@article{arxiv.2403.18361,
  title  = {ViTAR: Vision Transformer with Any Resolution},
  author = {Qihang Fan and Quanzeng You and Xiaotian Han and Yongfei Liu and Yunzhe Tao and Huaibo Huang and Ran He and Hongxia Yang},
  journal= {arXiv preprint arXiv:2403.18361},
  year   = {2024}
}