基于小波变换的 Vision Transformer 图像标记器
计算机视觉与模式识别
2024-05-30 v1
摘要
非重叠的 patch 级卷积是所有最新 Vision Transformer(ViT)模型默认的图像标记器。尽管已提出许多 ViT 变体来提高其效率和准确性,但文献中关于改进图像标记器本身的研究仍很少。本文提出了一种基于小波变换的新图像标记器。我们展示,采用新标记器的 ViT 模型在 ImageNet 验证集上实现更高的训练吞吐量和更好的 top-1 精度。我们对为何在不改变 ViT 模型架构的前提下,所提标记器能提高训练吞吐量进行了理论分析。我们的分析表明,新标记器能够有效处理高分辨率图像,并对对抗性攻击天然具有抗性。此外,所提图像标记器为 ViT 基于模型设计的重要新研究方向提供了 fresh perspective,例如用于图像理解的非均匀网格上的图像标记。
引用
@article{arxiv.2405.18616,
title = {Wavelet-Based Image Tokenizer for Vision Transformers},
author = {Zhenhai Zhu and Radu Soricut},
journal= {arXiv preprint arXiv:2405.18616},
year = {2024}
}