中文

SAG-ViT:一种具有图注意力的尺度感知、高保真补丁方法用于视觉 Transformer

计算机视觉与模式识别 2025-01-09 v3 人工智能 机器学习

摘要

视觉 Transformer(ViT)通过利用自注意力捕捉图像补丁之间的复杂模式和长程依赖,重新定义了图像分类。然而,ViT 的一个关键挑战是如何高效地融合多尺度特征表示,这在卷积神经网络(CNN)中通过其层级结构固有地实现。图 Transformer 通过利用基于图的建模在这方面取得了进展,但它们往往丢失或不充分地表示空间层级,特别是因为冗余或不太相关的区域稀释了图像的上下文表示。为了弥合这一差距,我们提出了 SAG-ViT,一种尺度感知图注意力 ViT,它融合了 CNN 的多尺度特征能力、ViT 的表示能力、图注意力补丁以实现更丰富的上下文表示。使用 EfficientNetV2 作为骨干网络,模型提取多尺度特征图,将其划分为补丁,相比直接对输入图像进行补丁划分,保留了更丰富的语义信息。利用空间和特征相似性将补丁构建为图,图注意力网络(GAT)细化节点嵌入。然后由 Transformer 编码器处理这种细化后的图表示,捕捉长程依赖和复杂交互。我们在跨多个领域的基准数据集上评估了 SAG-ViT,验证了其在推进图像分类任务方面的有效性。我们的代码和权重可在 https://github.com/shravan-18/SAG-ViT 获取。

关键词

引用

@article{arxiv.2411.09420,
  title  = {SAG-ViT: A Scale-Aware, High-Fidelity Patching Approach with Graph Attention for Vision Transformers},
  author = {Shravan Venkatraman and Jaskaran Singh Walia and Joe Dhanith P R},
  journal= {arXiv preprint arXiv:2411.09420},
  year   = {2025}
}

备注

14 pages, 8 figures, 9 tables