中文

Vision GNN:图像即节点图

计算机视觉与模式识别 2022-11-07 v3

摘要

网络架构在基于深度学习的计算机视觉系统中起着关键作用。广泛使用的卷积神经网络和 transformer 将图像视为网格或序列结构,难以灵活捕捉不规则且复杂的物体。本文中,我们提出将图像表示为图结构,并引入一种新的 Vision GNN (ViG) 架构来提取视觉任务的图级特征。我们首先将图像分割为若干视为节点的图像块,并通过连接最近邻构建图。基于图像的图表示,我们构建 ViG 模型以在所有节点间传递和交换信息。ViG 由两个基本模块组成:使用图卷积聚合和更新图信息的 Grapher 模块,以及使用两个线性层进行节点特征变换的 FFN 模块。我们构建了不同模型规模的各向同性和金字塔结构的 ViG。在图像识别和物体检测任务上的大量实验证明了我们 ViG 架构的优越性。我们希望这一将 GNN 用于通用视觉任务的开创性研究能为未来研究提供有益的启发与经验。PyTorch 代码见 https://github.com/huawei-noah/Efficient-AI-Backbones,MindSpore 代码见 https://gitee.com/mindspore/models。

关键词

引用

@article{arxiv.2206.00272,
  title  = {Vision GNN: An Image is Worth Graph of Nodes},
  author = {Kai Han and Yunhe Wang and Jianyuan Guo and Yehui Tang and Enhua Wu},
  journal= {arXiv preprint arXiv:2206.00272},
  year   = {2022}
}

备注

NeurIPS 2022