RoboSVG:基于多模态引导的交互式 SVG 生成统一框架
计算机视觉与模式识别
2025-10-28 v1 计算与语言
摘要
可缩放矢量图形 (SVG) 是数字设计和机器人控制的基础,编码不仅包含视觉结构,还包含交互绘图中的运动路径。本文介绍了 RoboSVG,一个用于生成以文本、视觉和数值信号为导向的交互式 SVG 的统一多模态框架。给定输入查询后,RoboSVG 模型首先产生多模态引导,然后通过专用的生成模块合成候选 SVG,最后在数值引导下进行细化,以产生高质量输出。为支持该框架,我们构建了 RoboDraw 数据集,包含一百万个示例,每个示例将 SVG 生成条件(例如文本、图像和部分 SVG)与其对应的地面实况 SVG 代码配对。RoboDraw 数据集支持系统研究四项任务,包括基本生成(Text-to-SVG、Image-to-SVG)和交互式生成(PartialSVG-to-SVG、PartialImage-to-SVG)。广泛实验表明,RoboSVG 在各任务中实现了优异的查询合规性和视觉保真度,建立了该领域多功能 SVG 生成的新状态。该项目的数据集和源代码将很快公开。
关键词
引用
@article{arxiv.2510.22684,
title = {RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance},
author = {Jiuniu Wang and Gongjie Zhang and Quanhao Qian and Junlong Gao and Deli Zhao and Ran Xu},
journal= {arXiv preprint arXiv:2510.22684},
year = {2025}
}
备注
15 pages, 5 figures