压缩图像至补丁以适配视觉 Transformer
计算机视觉与模式识别
2025-02-18 v2
摘要
视觉 Transformer (ViT) 在计算机视觉领域取得了显著进展。然而随着模型深度和输入图像分辨率的增加,训练和运行 ViT 模型的计算成本急剧上升。本文提出一种基于 CNN 和视觉 Transformer 的混合模型,命名为 CI2P-ViT。该模型包含名为 CI2P 的模块,利用 CompressAI 编码器压缩图像,并通过一系列卷积生成补丁序列。CI2P 可替换 ViT 模型中的 Patch Embedding 组件,实现对现有 ViT 模型的无缝集成。相较于 ViT-B/16,CI2P-ViT 将输入自注意力层的补丁数量减少为原来的四分之一。该设计不仅显著降低了 ViT 模型的计算成本,还通过引入 CNN 的归纳偏置属性有效提升了模型精度。实验表明,CI2P-ViT 在 Animals-10 数据集上从头训练,准确率达到 92.37%,相较于 ViT-B/16 baseline 提升 3.3%。此外,模型的浮点运算次数 (FLOPs) 降低 63.35%,在相同硬件配置下训练速度提升约两倍。
引用
@article{arxiv.2502.10120,
title = {Compress image to patches for Vision Transformer},
author = {Xinfeng Zhao and Yaoru Sun},
journal= {arXiv preprint arXiv:2502.10120},
year = {2025}
}
备注
15 pages,5 figures