中文

CraftSVG:基于布局引导扩散的多对象文本到SVG合成

计算机视觉与模式识别 2025-12-02 v3 机器学习

摘要

从文本提示生成矢量艺术是一项具有挑战性的视觉任务,需要对已见及未见实体进行多样且真实的描绘。然而,现有的研究大多局限于生成单个对象,而非包含多个元素的完整场景。作为回应,本工作提出了SVGCraft,这是一个新颖的端到端框架,用于根据文本描述创建描绘整个场景的矢量图形。该框架利用预训练的LLM从文本提示生成布局,引入了一种在指定边界框内生成掩码潜在表示的技术,以实现对象的精确放置。它引入了融合机制来整合注意力图,并采用扩散U-Net进行连贯组合,从而加快了绘制过程。生成的SVG使用预训练编码器和带有不透明度调制的LPIPS损失进行优化,以最大化相似度。此外,本工作还探索了基本形状在受限环境中促进画布补全的潜力。通过定性和定量评估,结果表明SVGCraft在抽象性、可识别性和细节方面超越了先前的工作,其性能指标证明了这一点(CLIP-T: 0.4563, Cosine Similarity: 0.6342, Confusion: 0.66, Aesthetic: 6.7832)。代码可在 https://github.com/ayanban011/SVGCraft 获取。

关键词

引用

@article{arxiv.2404.00412,
  title  = {CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion},
  author = {Ayan Banerjee and Nityanand Mathur and Josep Llados and Umapada Pal and Anjan Dutta},
  journal= {arXiv preprint arXiv:2404.00412},
  year   = {2025}
}