中文

ClusterViG:通过图像分区实现高效全局感知视觉图神经网络

计算机视觉与模式识别 2025-04-23 v2 分布式、并行与集群计算

摘要

卷积神经网络 (CNN) 和视觉变换器 (ViT) 在计算机视觉领域占据主导地位。图神经网络 (GNN) 因其能够通过非结构化图表示复杂关系而在 diverse 领域取得显著成绩。然而,直至引入视觉图神经网络 (ViG) 之前,GNN 在视觉任务中的应用尚未被探索。尽管 ViG 取得了成功,但其性能严重受限于基于 kk-最近邻 (kk-NN) 的图构建。近期研究为解决这一瓶颈,施加了约束以限制 GNN 构建非结构化图的灵活性,进而削弱其核心优势并引入额外效率问题。为此,本文提出一种新方法,即动态高效图卷积 (DEGC),用于设计高效且全局感知的 ViG。DEGC 将输入图像分区并并行构建每个分区的图,从而提高图构建效率。进一步,DEGC 集成了局部图内特征学习和全局图间特征学习,实现更强的全局上下文感知。使用 DEGC 作为构建模块,我们提出了一种新型 CNN-GNN 架构,即 ClusterViG,用于计算机视觉任务。广泛实验表明,ClusterViG 在各种模型(包括 ViG、ViHGNN、PVG 和 GreedyViG)之上,针对图像分类、目标检测和实例分割任务,端到端推理延迟降低最高可达 5×5\times,且参数数量相近。此外,ClusterViG 在图像分类、目标检测和实例分割任务上达到最先进性能,表明所提出的全局感知学习策略有效。最后,DEGC 实现的输入分区使 ClusterViG 能够在更高分辨率图像上高效训练,凸显了该方法的可扩展性。

关键词

引用

@article{arxiv.2501.10640,
  title  = {ClusterViG: Efficient Globally Aware Vision GNNs via Image Partitioning},
  author = {Dhruv Parikh and Jacob Fein-Ashley and Tian Ye and Rajgopal Kannan and Viktor Prasanna},
  journal= {arXiv preprint arXiv:2501.10640},
  year   = {2025}
}

备注

IEEE MCNA 2025