中文

语义文档去渲染:基于视觉语言建模的 SVG 重建

计算机视觉与模式识别 2025-11-18 v1 人工智能 机器学习

摘要

多媒体文档(如演示文稿和海报)设计上具有交互性和可修改性。然而,这些文档常以静态光栅格式分发,限制了编辑和定制功能。恢复其可编辑性需要将这些光栅图像转换回结构化矢量格式。然而,现有的几何光栅-矢量化方法依赖曲线和多边形等低级原语,难以完成此任务。具体而言,当应用于复杂文档(如演示文稿)时,这些方法无法保留高层次结构,导致得到平坦的形状集合,其中图像元素与文本元素的语义区分被丢失。为克服这一限制,我们提出解决语义文档去渲染问题的方法,引入 SliDer 框架,使用视觉语言模型(Vision-Language Models, VLM)将幻灯片图像去渲染为紧凑且可编辑的可缩放矢量图形(Scalable Vector Graphic, SVG)表示。SliDer 检测并提取光栅输入中各个图像和文本元素的属性,并将其组织成连贯的 SVG 格式。关键在于,模型在推理过程中进行迭代细化,类似于人类的设计过程,生成更忠实地重建原始光栅图像的 SVG 代码。此外,我们引入了 Slide2SVG 数据集,包含来自真实科学演示文稿的光栅-SVG 配对,旨在促进该领域的后续研究。我们的结果表明,SliDer 在重建 LPIPS 上达到 0.069,在 82.9% 的情况下相对于最强的零样本 VLM 基线更受人类评估者青睐。

关键词

引用

@article{arxiv.2511.13478,
  title  = {Semantic Document Derendering: SVG Reconstruction via Vision-Language Modeling},
  author = {Adam Hazimeh and Ke Wang and Mark Collier and Gilles Baechler and Efi Kokiopoulou and Pascal Frossard},
  journal= {arXiv preprint arXiv:2511.13478},
  year   = {2025}
}