LookupViT:将视觉信息压缩至有限数量的标记
计算机视觉与模式识别
2024-07-18 v1 人工智能
机器学习
摘要
Vision Transformer (ViT) 已成为众多行业级视觉解决方案事实上的首选,但其推理成本在许多场景下仍不可接受,因为其在每一层计算自注意力机制,导致标记数量的平方级计算复杂度。另一方面,图像中的空间信息以及视频中的时空信息通常稀疏且冗余。本文引入 LookupViT,通过利用这种信息稀疏性来降低 ViT 的推理成本。LookupViT 提供一种新颖的通用视觉转换器模块,其通过将更高分辨率标记的信息压缩至固定数量的标记。少数压缩后标记经过精细处理,而更高分辨率的标记则通过计算更廉价的层传递。通过双向交叉注意力机制,实现了这两组标记之间的信息共享。该方法具有多项优势——(a) 可通过标准高级算子在标准 ML 加速器 (GPU/TPU) 上轻松实现,(b) 可用于标准 ViT 及其变体,因而适用于各种任务,(c) 可处理不同的标记化与注意力方法。LookupViT 也为压缩后标记提供了灵活性,使其在单一训练模型中实现性能-计算权衡。我们在多个领域展示了 LookupViT 的有效性——(a) 图像分类 (ImageNet-1K 与 ImageNet-21K),(b) 视频分类 (Kinetics400 与 Something-Something V2),(c) 图像字幕 (COCO-Captions) 采用冻结编码器。实验表明,LookupViT 在这些领域可实现 FLOPs 的 降低,同时保持或提升准确率。此外,LookupViT 还在图像分类 (ImageNet-C、R、A、O) 上表现出即插即用式的鲁棒性与泛化能力,准确率较 ViT 提升最高可达 。
引用
@article{arxiv.2407.12753,
title = {LookupViT: Compressing visual information to a limited number of tokens},
author = {Rajat Koner and Gagan Jain and Prateek Jain and Volker Tresp and Sujoy Paul},
journal= {arXiv preprint arXiv:2407.12753},
year = {2024}
}
备注
ECCV 2024