中文

Render-in-the-Loop:基于视觉自反馈的矢量图形生成

计算机视觉与模式识别 2026-04-24 v2

摘要

多模态大语言模型 (MLLMs) 在通过直接代码合成生成可缩放矢量图形 (SVG) 方面展现出令人期待的能力。然而,现有范式通常采用开环的“盲画”方法,模型生成符号化代码序列时并不感知中间的视觉结果。这种方法严重未充分利用 MLLMs 视觉编码器中嵌入的强大视觉先验,将 SVG 生成视为一个脱节的文本序列建模任务,而非一个整合的视觉-空间任务。因此,模型难以推理部分画布状态和隐式遮挡关系,这些关系在视觉上显而易见,但在文本上却含糊不清。为弥合这一差距,我们提出了 Render-in-the-Loop,一种将 SVG 合成重新表述为逐步的、视觉上下文感知过程的新型生成范式。通过将中间代码状态渲染到累积画布上,模型在每一步都显式地观察不断演变的视觉上下文,利用即时反馈来指导后续生成。然而,我们证明,将这种视觉循环直接应用于现成模型是次优的,因为它们无法利用增量的视觉-代码映射。为解决此问题,我们首先利用细粒度路径分解来构建密集的多步视觉轨迹,然后引入视觉自反馈 (VSF) 训练策略,以中间视觉状态为条件生成下一个图元。此外,还提出了一种渲染-验证 (RaV) 推理机制,以有效过滤退化和冗余的图元。我们的框架在多模态基础模型上实例化,在标准 MMSVGBench 基准上优于强大的开放权重基线。这一结果凸显了我们的 Render-in-the-Loop 范式在文本到 SVG 和图像到 SVG 任务中卓越的数据效率和泛化能力。

关键词

引用

@article{arxiv.2604.20730,
  title  = {Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback},
  author = {Guotao Liang and Zhangcheng Wang and Juncheng Hu and Haitao Zhou and Ziteng Xue and Jing Zhang and Dong Xu and Qian Yu},
  journal= {arXiv preprint arXiv:2604.20730},
  year   = {2026}
}