中文

Chat2SVG:基于大语言模型和图像扩散模型的矢量图形生成

计算机视觉与模式识别 2025-11-13 v2 图形学

摘要

可缩放矢量图形 (SVG) 已成为数字设计中矢量图形的事实标准,具有分辨率独立性和对单个元素进行精确控制的优势。尽管如此,创建高质量的 SVG 内容仍然具有挑战性,因为这需要专业编辑软件的技术专业知识,并且需要花费大量时间来制作复杂的图形。最近的文本到 SVG 生成方法旨在使矢量图形创建更加可及,但仍存在形状规律性、泛化能力和表达性方面的局限性。为解决这些挑战,我们引入了 Chat2SVG,一个结合了大语言模型 (LLM) 和图像扩散模型的混合框架,用于文本到 SVG 的生成。我们的方法首先使用 LLM 从基本几何原语生成语义上有意义的 SVG 模板。通过图像扩散模型的引导,双阶段优化管道在潜在空间中细化路径,并调整点坐标以增强几何复杂度。广泛的实验表明,Chat2SVG 在视觉保真度、路径规律性和语义对齐方面均优于现有方法。此外,我们的系统通过自然语言指令实现了直观的编辑,使专业矢量图形创建变得易于所有用户。

关键词

引用

@article{arxiv.2411.16602,
  title  = {Chat2SVG: Vector Graphics Generation with Large Language Models and Image Diffusion Models},
  author = {Ronghuan Wu and Wanchao Su and Jing Liao},
  journal= {arXiv preprint arXiv:2411.16602},
  year   = {2025}
}

备注

Project Page: https://chat2svg.github.io/