中文

OmniSVG:统一的可缩放矢量图形生成模型

计算机视觉与模式识别 2025-12-02 v3

摘要

可缩放矢量图形(SVG)是一种重要的图像格式,因其分辨率无关性和可编辑性而在图形设计中被广泛采用。生成高质量SVG的研究持续吸引着AIGC社区的设计师和研究人员。然而,现有方法要么产生非结构化输出且计算成本巨大,要么局限于生成结构过于简化的单色图标。为了生成高质量且复杂的SVG,我们提出了OmniSVG,一个利用预训练视觉语言模型(VLM)进行端到端多模态SVG生成的统一框架。通过将SVG命令和坐标参数化为离散标记,OmniSVG将结构逻辑与底层几何解耦,以实现高效训练,同时保持复杂SVG结构的表达能力。为了进一步推动SVG合成的发展,我们引入了MMSVG-2M,一个包含两百万个丰富注释SVG资产的多模态数据集,以及一个用于条件SVG生成任务的标准化评估协议。大量实验表明,OmniSVG优于现有方法,并展示了其集成到专业SVG设计工作流程中的潜力。

关键词

引用

@article{arxiv.2504.06263,
  title  = {OmniSVG: A Unified Scalable Vector Graphics Generation Model},
  author = {Yiying Yang and Wei Cheng and Sijin Chen and Xianfang Zeng and Fukun Yin and Jiaxu Zhang and Liao Wang and Gang Yu and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2504.06263},
  year   = {2025}
}

备注

20 pages; Project Page: https://omnisvg.github.io/