中文

RoboSVG:基于多模态引导的交互式 SVG 生成统一框架

计算机视觉与模式识别 2025-10-28 v1 计算与语言

摘要

可缩放矢量图形 (SVG) 是数字设计和机器人控制的基础,编码不仅包含视觉结构,还包含交互绘图中的运动路径。本文介绍了 RoboSVG,一个用于生成以文本、视觉和数值信号为导向的交互式 SVG 的统一多模态框架。给定输入查询后,RoboSVG 模型首先产生多模态引导,然后通过专用的生成模块合成候选 SVG,最后在数值引导下进行细化,以产生高质量输出。为支持该框架,我们构建了 RoboDraw 数据集,包含一百万个示例,每个示例将 SVG 生成条件(例如文本、图像和部分 SVG)与其对应的地面实况 SVG 代码配对。RoboDraw 数据集支持系统研究四项任务,包括基本生成(Text-to-SVG、Image-to-SVG)和交互式生成(PartialSVG-to-SVG、PartialImage-to-SVG)。广泛实验表明,RoboSVG 在各任务中实现了优异的查询合规性和视觉保真度,建立了该领域多功能 SVG 生成的新状态。该项目的数据集和源代码将很快公开。

关键词

引用

@article{arxiv.2510.22684,
  title  = {RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance},
  author = {Jiuniu Wang and Gongjie Zhang and Quanhao Qian and Junlong Gao and Deli Zhao and Ran Xu},
  journal= {arXiv preprint arXiv:2510.22684},
  year   = {2025}
}

备注

15 pages, 5 figures