中文

IntroSVG:基于自省生成-批判框架通过渲染反馈学习文本到SVG生成

计算机视觉与模式识别 2026-03-11 v1

摘要

矢量图形(SVG)因其内在的可扩展性和可编辑性而在数字设计中居于核心地位。尽管视觉语言模型(VLM)促进了内容生成取得了显著进展,但现有的文本到SVG生成方法受到一个核心挑战的限制:自回归训练过程未能包含最终渲染图像的视觉感知,这从根本上限制了生成质量。为解决这一限制,我们提出了自省SVG生成框架(IntroSVG)。该框架的核心在于实例化一个在闭环中运行的统一VLM,既扮演生成器又扮演批判家的角色。具体而言,通过监督微调(SFT),模型学习绘制SVG并提供其渲染输出的反馈;此外,我们系统性地将早期阶段的失败转化为高质量的纠错训练数据,从而增强模型的鲁棒性。随后,我们利用高容量教师VLM构建偏好数据集,并通过直接偏好优化(DPO)进一步对生成器的策略进行对齐。在推断期,优化后的生成器和批判家在迭代的“生成-审查-细化”循环中协同工作,从不完美的中间草稿自动提升输出质量。实验结果表明,我们的方法在多个关键评估指标上实现了最先进的性能,生成的SVG具有更复杂的结构、更强的语义对齐和更大的可编辑性。这些结果证实了将显式视觉反馈纳入生成循环的有效性。

关键词

引用

@article{arxiv.2603.09312,
  title  = {IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework},
  author = {Feiyu Wang and Jiayuan Yang and Zhiyuan Zhao and Da Zhang and Bingyu Li and Peng Liu and Junyu Gao},
  journal= {arXiv preprint arXiv:2603.09312},
  year   = {2026}
}