中文

GvT:一种基于图的视觉Transformer,利用稀疏性和Talking-Heads,在小数据集上从头训练

计算机视觉与模式识别 2025-06-04 v2 人工智能

摘要

视觉Transformer(ViT)在大规模图像分类中取得了令人印象深刻的结果。然而,当在小数据集上从头训练时,ViT与卷积神经网络(CNN)之间仍存在显著的性能差距,这归因于缺乏归纳偏置。为了解决这个问题,我们提出了一种基于图的视觉Transformer(GvT),它利用图卷积投影和图池化。在每个块中,查询和键通过基于空间邻接矩阵的图卷积投影计算,而点积注意力用于另一个图卷积以生成值。当使用更多注意力头时,查询和键的维度降低,使得它们的点积成为信息量不足的匹配函数。为了克服注意力头中的低秩瓶颈,我们采用了基于双线性池化特征和注意力张量稀疏选择的talking-heads技术。这允许过滤后的注意力分数之间进行交互,并使每个注意力机制依赖于所有查询和键。此外,我们在两个中间块之间应用图池化以减少令牌数量并更有效地聚合语义信息。我们的实验结果表明,GvT产生了与深度卷积网络相当或更优的结果,并且超越了没有在大数据集上预训练的视觉Transformer。我们提出的模型的代码已在网站上公开。

关键词

引用

@article{arxiv.2404.04924,
  title  = {GvT: A Graph-based Vision Transformer with Talking-Heads Utilizing Sparsity, Trained from Scratch on Small Datasets},
  author = {Dongjing Shan and guiqiang chen},
  journal= {arXiv preprint arXiv:2404.04924},
  year   = {2025}
}

备注

The authors withdraw this article to revise and improve the paper through substantial adjustments and rewriting