采用混合分辨率分词的视觉Transformer
计算机视觉与模式识别
2023-04-28 v2
摘要
Vision Transformer模型通过将输入图像划分为空间规则等尺寸块网格来处理图像。相反,Transformer最初是针对自然语言序列提出的,其中每个token表示一个子词——任意大小原始数据的一块。在本工作中,我们将此方法应用于Vision Transformer,引入一种新颖的图像分词方案,以混合分辨率的token序列取代标准均匀网格,其中每个token表示任意大小的块。利用四叉树算法与一种新颖的显著性评分器,我们构建块马赛克,其中图像低显著性区域以低分辨率处理,将模型更多容量路由至重要图像区域。在使用与原始ViT相同架构的情况下,我们的Quadformer模型在控制计算预算时于图像分类上取得显著精度提升。代码与模型公开于https://github.com/TomerRonen34/mixed-resolution-vit。
引用
@article{arxiv.2304.00287,
title = {Vision Transformers with Mixed-Resolution Tokenization},
author = {Tomer Ronen and Omer Levy and Avram Golbert},
journal= {arXiv preprint arXiv:2304.00287},
year = {2023}
}