中文

StarVector:从图像和文本生成可缩放矢量图形代码

计算机视觉与模式识别 2025-06-03 v4 人工智能 计算与语言

摘要

可缩放矢量图形(SVG)因其可扩展性和多功能性而成为现代图像渲染的关键。先前的 SVG 生成方法主要集中在基于曲线的矢量化,缺乏语义理解,经常产生伪影,并且在处理路径曲线以外的 SVG 原语时遇到困难。为了解决这些问题,我们引入了 StarVector,一种用于 SVG 生成的多模态大型语言模型。它通过理解图像语义并使用 SVG 原语进行紧凑、精确的输出,执行图像矢量化。与传统方法不同,StarVector 直接在 SVG 代码空间中工作,利用视觉理解来应用准确的 SVG 原语。为了训练 StarVector,我们创建了 SVG-Stack,这是一个包含 200 万样本的多样化数据集,能够实现跨矢量化任务的泛化以及对椭圆、多边形和文本等原语的精确使用。我们解决了 SVG 评估中的挑战,指出基于像素的指标(如 MSE)无法捕捉矢量图形的独特品质。我们引入了 SVG-Bench,这是一个涵盖 10 个数据集和 3 个任务(图像到 SVG、文本到 SVG 生成以及图表生成)的基准。利用此设置,StarVector 实现了最先进(SOTA)的性能,生成了更紧凑且语义丰富的 SVG。

关键词

引用

@article{arxiv.2312.11556,
  title  = {StarVector: Generating Scalable Vector Graphics Code from Images and Text},
  author = {Juan A. Rodriguez and Abhay Puri and Shubham Agarwal and Issam H. Laradji and Pau Rodriguez and Sai Rajeswar and David Vazquez and Christopher Pal and Marco Pedersoli},
  journal= {arXiv preprint arXiv:2312.11556},
  year   = {2025}
}