中文

基于图卷积网络增强的层次化视觉变换器用于图像分类

计算机视觉与模式识别 2026-04-21 v1 人工智能

摘要

视觉变换器(ViT)通过引入自注意力机制为图像分类领域带来了新的突破,而图卷积网络(GCN)则被提出并成功应用于数据表示和分析。然而,仍存在若干关键挑战限制其进一步发展:(1)ViT所选取的补丁大小对准确预测至关重要,这自然提出了一个问题:如何正确选择补丁大小,或如何全面地组合小补丁和大补丁;(2)虽然在视觉任务中空间结构信息至关重要,但1维位置嵌入无法更准确地捕捉补丁的空间结构信息;(3)GCN能够捕捉图像节点之间的局部连通关系,但缺乏捕捉全局图结构信息的能力。相反,ViT的自注意力机制能够在图像补丁之间建立全局关系,但无法建模图像的局部结构。为克服这些限制,我们提出了一种基于图卷积网络增强的层次化视觉变换器(GCN-HViT)用于图像分类。具体而言,我们设计的层次化ViT能够在每个层级内部对补丁级别的信息进行全局尺度的相互作用建模,并在多个层级之间对小补丁和大补丁之间的层次关系进行建模。此外,提出的GCN方法作为局部特征提取器,获取每个图像补丁的局部表示,作为2D空间中每个补丁的位置嵌入。同时,它在每个层级内部对补丁级别的信息进行局部尺度的相互作用建模。在3个真实世界数据集上的大量实验表明,GCN-HViT实现了最先进的性能。

关键词

引用

@article{arxiv.2604.16823,
  title  = {Hierarchical Vision Transformer Enhanced by Graph Convolutional Network for Image Classification},
  author = {Haibin Jiao},
  journal= {arXiv preprint arXiv:2604.16823},
  year   = {2026}
}