面向向量图理解与生成的统一数据集:面向多模态大语言模型的UniSVG
逻辑
2025-08-12 v1
摘要
与位图图像不同,可缩放矢量图(SVG)在放大时保持图像质量,广泛应用于计算机视觉和艺术设计中作为SVG代码的表示方式。在AI驱动系统日益增长的时代,使AI能够理解和生成SVG正变得越来越迫切。然而,AI驱动的SVG理解与生成(U&G)仍面临重大挑战。SVG代码等同于由浮点参数控制的曲线和线的集合,对SVG U&G要求高度精确。此外,SVG生成需在多种条件约束下进行,包括文本提示和视觉参考,这需要强大的多模态处理来实现条件到SVG的转换。最近,多模态大语言模型(MLLMs)的快速发展表明,能够处理多模态输入并生成复杂向量控制参数,具有潜在的解决SVG U&G任务的能力。为发掘MLLMs在SVG领域的潜能,我们提出一种以SVG为中心的数据集,称为UniSVG,包含52.5万条数据,专为MLLMs训练和评估设计。据我们了解,这是第一个为统一SVG生成(从文本提示和图像)和SVG理解(颜色、类别、用途等)而设计的全面数据集。如期而然,在该数据集上进行学习可提升开源MLLMs在various SVG U&G任务上的性能,超过像GPT-4V这样的SOTA闭源MLLMs。我们在https://ryanlijinke.github.io/上发布了数据集、基准、模型权重、代码和实验细节。
引用
@article{arxiv.2508.07765,
title = {Isomorphism of almost locally compact Polish metric structures},
author = {Maciej Malicki},
journal= {arXiv preprint arXiv:2508.07765},
year = {2025}
}