从视觉基础模型引导 SparseFormers
计算机视觉与模式识别
2024-04-05 v2
摘要
最近提出的 SparseFormer 架构通过调整 RoIs 利用数量显著减少的视觉 token,提供了一种视觉理解的替代方法,在大幅降低计算成本的同时仍取得了有前景的性能。然而,从头训练 SparseFormers 仍然成本高昂,且扩大参数数量具有挑战性。在本文中,我们提出以一种简单高效的方式从基于 ViT 的视觉基础模型引导 SparseFormers。由于 SparseFormer 的大多数模块是标准 Transformer 模块,我们可以从大规模预训练的视觉 Transformer 中继承权重,并尽可能冻结它们。因此,我们只需训练 SparseFormer 特有的轻量级聚焦 Transformer 来调整 token RoIs,并微调少数早期的预训练模块以对齐最终的 token 表示。通过这种方式,我们可以使用相当少量的训练样本(例如 IN-1K),且无需标签或标题,在短短几小时内从各种大规模预训练模型(例如 IN-21K 预训练的 AugRegs 或 CLIPs)引导 SparseFormer 架构。结果表明,从 AugReg-ViT-L/16-384 引导的单模态 SparseFormer 在 IN-1K 上仅用 49 个 token 即可达到 84.9% 的准确率,而从 CLIPs 引导的多模态 SparseFormer 在引导过程中未见任何标题的情况下,也展现了显著的零样本性能,且计算成本大幅降低。此外,与语言对齐输出空间而未见任何单词的 CLIP 引导的 SparseFormers,可作为多模态大语言模型中的高效视觉编码器。代码和模型可在 https://github.com/showlab/sparseformer 获取。
引用
@article{arxiv.2312.01987,
title = {Bootstrapping SparseFormers from Vision Foundation Models},
author = {Ziteng Gao and Zhan Tong and Kevin Qinghong Lin and Joya Chen and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2312.01987},
year = {2024}
}
备注
CVPR 2024