ViSketch-GPT:用于草图识别与生成的协作多尺度特征提取
计算机视觉与模式识别
2025-03-31 v1 人工智能
摘要
理解人类草图的本质具有挑战性,因为其创建方式差异很大。识别复杂结构模式可提高草图识别的准确率以及生成草图的保真度。在本工作中,我们引入了 ViSketch-GPT,这是一种新型算法,通过多尺度上下文提取方法来解决这些挑战。该模型在多个尺度上捕获精细细节,并通过类似集成的机制对其进行组合,其中提取的特征协同工作,以增强对关键细节的识别和生成,这些细节对于分类和生成任务至关重要。通过在 QuickDraw 数据集上进行大量实验验证了 ViSketch-GPT 的有效性。我们的模型在分类和生成任务中均建立了新的基准,显著优于现有方法,在准确率和生成草图的保真度方面实现了显著提升。该提议算法为理解复杂结构(如草图)提供了一种通过提取协同识别精细细节的稳健框架,增强了对此类结构的理解,使其成为计算机视觉和机器学习领域的多用途工具。
关键词
引用
@article{arxiv.2503.22374,
title = {ViSketch-GPT: Collaborative Multi-Scale Feature Extraction for Sketch Recognition and Generation},
author = {Giulio Federico and Giuseppe Amato and Fabio Carrara and Claudio Gennaro and Marco Di Benedetto},
journal= {arXiv preprint arXiv:2503.22374},
year = {2025}
}