AttentionViG: 基于交叉注意力的视觉 GNN 中的动态邻居聚合
计算机视觉与模式识别
2025-10-01 v1 人工智能
图像与视频处理
摘要
视觉图神经网络(ViGs)在图像识别任务中展现出了对卷积神经网络(CNNs)和视觉变换器(ViTs)的有前景的性能。ViG 框架的一个关键部分是节点邻居特征聚合方法。虽然已探索了各种图卷积方法,如 Max-Relative、EdgeConv、GIN 和 GraphSAGE,但仍需一种灵活的聚合方法,能够在不要求特定架构细化的情况下有效捕获复杂的节点邻居关系。为此,本文提出了一种基于交叉注意力的聚合方法,其中查询投影来自节点,而键投影来自其邻居。此外,我们引入了一种新型架构称为 AttentionViG,该架构使用所提出的交叉注意力聚合方案进行非本地消息传递。我们在 ImageNet-1K 基准上评估了 AttentionViG 的图像识别性能,其中它实现了最佳性能(SOTA)。此外,我们评估了其在下游任务中的可迁移性,包括在 MS COCO 2017 上的目标检测和实例分割,以及 ADE20K 上的语义分割。我们的结果表明,所提出的方法不仅实现了强大的性能,而且保持了效率,在与先前视觉 GNN 架构相当的 FLOPs 下,实现了竞争的准确率。
引用
@article{arxiv.2509.25570,
title = {AttentionViG: Cross-Attention-Based Dynamic Neighbor Aggregation in Vision GNNs},
author = {Hakan Emre Gedik and Andrew Martin and Mustafa Munir and Oguzhan Baser and Radu Marculescu and Sandeep P. Chinchali and Alan C. Bovik},
journal= {arXiv preprint arXiv:2509.25570},
year = {2025}
}
备注
WACV submission. 13 pages, including the main text (8 pages), references, and supplementary material