中文

基于小波变换的 Vision Transformer 图像标记器

计算机视觉与模式识别 2024-05-30 v1

摘要

非重叠的 patch 级卷积是所有最新 Vision Transformer(ViT)模型默认的图像标记器。尽管已提出许多 ViT 变体来提高其效率和准确性,但文献中关于改进图像标记器本身的研究仍很少。本文提出了一种基于小波变换的新图像标记器。我们展示,采用新标记器的 ViT 模型在 ImageNet 验证集上实现更高的训练吞吐量和更好的 top-1 精度。我们对为何在不改变 ViT 模型架构的前提下,所提标记器能提高训练吞吐量进行了理论分析。我们的分析表明,新标记器能够有效处理高分辨率图像,并对对抗性攻击天然具有抗性。此外,所提图像标记器为 ViT 基于模型设计的重要新研究方向提供了 fresh perspective,例如用于图像理解的非均匀网格上的图像标记。

关键词

引用

@article{arxiv.2405.18616,
  title  = {Wavelet-Based Image Tokenizer for Vision Transformers},
  author = {Zhenhai Zhu and Radu Soricut},
  journal= {arXiv preprint arXiv:2405.18616},
  year   = {2024}
}