面向高效视觉GNN的多尺度高分辨率对数图谱模块
计算机视觉与模式识别
2025-10-16 v1 人工智能
机器学习
摘要
视觉图神经网络(ViG)已在视觉任务中显示出作为传统卷积神经网络(CNN)和transformer(ViTs)的有前景的替代方案;然而,常见的图构建方法如k近邻(KNN)在大型图像上可能昂贵。虽然稀疏视觉图注意(SVGA)等方法已显示出前景,但SVGA的固定步长尺度可能导致过度压扁,遗漏多个连接以获取与长程链接相同的信息。基于此观察,我们提出了新的图构建方法——对数可扩展图构建(LSGC),通过限制长程链接的数量来提升性能。为此,我们提出了LogViG,一种新型的混合CNN-GNN模型,利用LSGC。此外,受多尺度和高分辨率架构成功的启发,我们引入并应用高分辨率分支,在高分辨率和低分辨率分支之间进行特征融合,构建多尺度高分辨率视觉GNN网络。广泛的实验表明,LogViG在图像分类和语义分割任务中在准确率、GMACs和参数方面均优于现有的ViG、CNN和ViT架构。我们最小的模型Ti-LogViG在ImageNet-1K上实现平均top-1准确率为79.9%,标准差为0.2%,比Vision GNN平均准确率高出1.7%,参数减少24.3%,GMACs减少35.3%。我们的工作表明,通过我们提出的LSGC对ViG在图构建中利用长程链接可以超越当前的SOTA ViG。代码可在 https://github.com/mmunir127/LogViG-Official 查阅。
引用
@article{arxiv.2510.13740,
title = {Multi-Scale High-Resolution Logarithmic Grapher Module for Efficient Vision GNNs},
author = {Mustafa Munir and Alex Zhang and Radu Marculescu},
journal= {arXiv preprint arXiv:2510.13740},
year = {2025}
}
备注
Published in the Proceedings of the Third Learning on Graphs Conference (LoG 2024)