中文

视觉模型在图结构理解中的弱应用之力

计算机视觉与模式识别 2025-10-30 v1 人工智能 机器学习

摘要

图神经网络通过自下而上的消息传递运作,根本不同于人类视觉感知,它直观地先捕捉全局结构。我们探讨了视觉模型用于图理解的潜在潜力,发现它们在既定基准测试上实现与 GNN 相当的性能,同时表现出截然不同的学习模式。这些不同的行为,结合现有基准测试将域特征与拓扑理解混合的局限性,激发我们提出 GraphAbstract 这个基准。该基准评估模型捕捉全局图属性的能力,如人类所示:识别组织原型、检测对称性、感知连通性强度、识别关键元素。我们的结果表明,视觉模型在需要整体结构理解的任务上显著优于 GNN,并在不同图规模下保持良好的可迁移性,而 GNN 在全局模式抽象方面困难,且随图规模增大而退化。本工作表明,视觉模型具备惊人的但被低估的图结构理解能力,特别适用于需要全局拓扑意识和尺度不变推理的问题。这为开发更有效的图基础模型提供了新的可能性,那些以整体模式识别为主导的任务。

关键词

引用

@article{arxiv.2510.24788,
  title  = {The Underappreciated Power of Vision Models for Graph Structural Understanding},
  author = {Xinjian Zhao and Wei Pang and Zhongkai Xue and Xiangru Jian and Lei Zhang and Yaoyao Xu and Xiaozhuang Song and Shu Wu and Tianshu Yu},
  journal= {arXiv preprint arXiv:2510.24788},
  year   = {2025}
}

备注

NeurIPS 2025