SketchGraphNet:一种用于大规模草图语料库识别的内存高效混合图 Transformer
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
本研究从图原生的视角探讨大规模草图识别,其中手绘草图被直接建模为结构化图,而非光栅图像或笔画序列。我们提出了 SketchGraphNet,一种混合图神经架构,它集成了局部消息传递与内存高效的全局注意力机制,且不依赖辅助的位置或结构编码。为了支持系统性评估,我们构建了 SketchGraph,这是一个包含 344 个类别、344 万个图结构草图的大规模基准,并包含两个变体(A 和 R)以反映不同的噪声条件。每个草图都被表示为一个具有归一化笔画顺序属性的时空图。在 SketchGraph-A 和 SketchGraph-R 上,SketchGraphNet 在统一训练配置下分别达到了 83.62% 和 87.61% 的 Top-1 准确率。与基于 Performer 的全局注意力相比,MemEffAttn 进一步将峰值 GPU 内存降低了 40% 以上,训练时间减少了 30% 以上,同时保持了相当的准确率。
引用
@article{arxiv.2603.07521,
title = {SketchGraphNet: A Memory-Efficient Hybrid Graph Transformer for Large-Scale Sketch Corpora Recognition},
author = {Shilong Chen and Mingyuan Li and Zhaoyang Wang and Zhonglin Ye and Haixing Zhao},
journal= {arXiv preprint arXiv:2603.07521},
year = {2026}
}