中文

计算机视觉中图神经网络与图Transformer的综述:任务导向视角

计算机视觉与模式识别 2024-08-15 v4 人工智能 机器学习

摘要

图神经网络(GNNs)在图表示学习中获得了发展势头,并推动了诸多领域的技术水平,例如数据挖掘(如社交网络分析和推荐系统)、计算机视觉(如目标检测和点云学习)以及自然语言处理(如关系抽取和序列学习)等。随着Transformers在自然语言处理和计算机视觉中的出现,图Transformer将图结构嵌入Transformer架构中,以克服局部邻域聚合的局限,同时避免严格的结构归纳偏置。本文从任务导向的视角对计算机视觉中的GNNs和图Transformer进行了全面综述。具体而言,我们根据输入数据的模态将其在计算机视觉中的应用分为五类,即2D自然图像、视频、3D数据、视觉+语言以及医学图像。在每一类中,我们进一步根据一组视觉任务划分应用。这种任务导向的分类法使我们能够审视不同基于GNN的方法如何应对每项任务以及这些方法表现如何。基于必要的预备知识,我们提供了任务的定义与挑战、对代表性方法的深入覆盖,以及关于见解、局限性和未来方向的讨论。

关键词

引用

@article{arxiv.2209.13232,
  title  = {A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective},
  author = {Chaoqi Chen and Yushuang Wu and Qiyuan Dai and Hong-Yu Zhou and Mutian Xu and Sibei Yang and Xiaoguang Han and Yizhou Yu},
  journal= {arXiv preprint arXiv:2209.13232},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI)