中文

野生SVG:面向实际场景的可靠SVG生成

计算机视觉与模式识别 2026-02-26 v1

摘要

我们提出了SVG提取任务,即将特定视觉输入从图像转换为可缩放矢量图形。现有多模态模型在生成来自干净渲染或文本描述的SVG时取得良好成绩,但在现实场景中由于自然图像引入的噪声、杂乱和领域偏移时表现不足。该方向的核心挑战在于缺乏合适的基准数据集。为此,我们引入了野生SVG基准数据集,由两个互补的数据集组成:Natural WildSVG数据集由包含公司标志的真实图像及其SVG标注构建而成,Synthetic WildSVG数据集则将复杂SVG渲染融合到真实场景中以模拟困难条件。这些资源为系统化的SVG提取基准测试提供了第一套基础设施。我们对最新多模态模型进行基准测试,发现当前方法在实际场景下可靠SVG提取方面的表现远低于需求。然而,迭代细化方法指向了可行的前进路径,模型能力正稳步提升。

关键词

引用

@article{arxiv.2602.21416,
  title  = {WildSVG: Towards Reliable SVG Generation Under Real-Word Conditions},
  author = {Marco Terral and Haotian Zhang and Tianyang Zhang and Meng Lin and Xiaoqing Xie and Haoran Dai and Darsh Kaushik and Pai Peng and Nicklas Scharpff and David Vazquez and Joan Rodriguez},
  journal= {arXiv preprint arXiv:2602.21416},
  year   = {2026}
}

备注

10 pages, 6 pages of additional material