中文

面向统一 SVG 任务的 InternSVG:多模态大语言模型

计算机视觉与模式识别 2026-02-10 v4

摘要

通用的 SVG 模型化因数据碎片化、方法在不同任务之间的可迁移性受限以及处理结构复杂性方面的困难而具有挑战性。为此,我们利用多模态大语言模型(MLLMs)的强大迁移和泛化能力实现对 SVG 理解、编辑和生成的统一建模。我们提出了InternSVG系列,一个集成的数据-基准-模型套件。其核心是SAgoge,最大且最全面的 SVG 任务多模态数据集,涵盖静态图形和动态动画,包括图标、长序列插图、科学图表和动态动画,支持不同难度水平的任务,与先前数据集相比提供更深层次的层次结构和更丰富的属性。基于此资源,我们引入了SArena,一个覆盖SAgoge所涵盖领域和难度谱系的伴随基准,提供全面的任务定义和标准化评估。建立在这些基础之上,我们提出了InternSVG,一个用于 SVG 理解、编辑和生成的统一MLLMs,采用SVG特定专用标记、基于子词的嵌入初始化和从短静态SVG到长序列插图再到复杂动画的两阶段训练策略。这种统一表述可正向迁移并提高整体性能。在SArena和先前基准上的实验表明,InternSVG 实现了显著的提升,并持续优于领先的开源和专有方案。

关键词

引用

@article{arxiv.2510.11341,
  title  = {InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models},
  author = {Haomin Wang and Jinhui Yin and Qi Wei and Wenguang Zeng and Lixin Gu and Shenglong Ye and Zhangwei Gao and Yaohui Wang and Yanting Zhang and Yuanqi Li and Yanwen Guo and Wenhai Wang and Kai Chen and Yu Qiao and Hongjie Zhang},
  journal= {arXiv preprint arXiv:2510.11341},
  year   = {2026}
}