语义文档去渲染:基于视觉语言建模的 SVG 重建
计算机视觉与模式识别
2025-11-18 v1 人工智能
机器学习
摘要
多媒体文档(如演示文稿和海报)设计上具有交互性和可修改性。然而,这些文档常以静态光栅格式分发,限制了编辑和定制功能。恢复其可编辑性需要将这些光栅图像转换回结构化矢量格式。然而,现有的几何光栅-矢量化方法依赖曲线和多边形等低级原语,难以完成此任务。具体而言,当应用于复杂文档(如演示文稿)时,这些方法无法保留高层次结构,导致得到平坦的形状集合,其中图像元素与文本元素的语义区分被丢失。为克服这一限制,我们提出解决语义文档去渲染问题的方法,引入 SliDer 框架,使用视觉语言模型(Vision-Language Models, VLM)将幻灯片图像去渲染为紧凑且可编辑的可缩放矢量图形(Scalable Vector Graphic, SVG)表示。SliDer 检测并提取光栅输入中各个图像和文本元素的属性,并将其组织成连贯的 SVG 格式。关键在于,模型在推理过程中进行迭代细化,类似于人类的设计过程,生成更忠实地重建原始光栅图像的 SVG 代码。此外,我们引入了 Slide2SVG 数据集,包含来自真实科学演示文稿的光栅-SVG 配对,旨在促进该领域的后续研究。我们的结果表明,SliDer 在重建 LPIPS 上达到 0.069,在 82.9% 的情况下相对于最强的零样本 VLM 基线更受人类评估者青睐。
引用
@article{arxiv.2511.13478,
title = {Semantic Document Derendering: SVG Reconstruction via Vision-Language Modeling},
author = {Adam Hazimeh and Ke Wang and Mark Collier and Gilles Baechler and Efi Kokiopoulou and Pascal Frossard},
journal= {arXiv preprint arXiv:2511.13478},
year = {2025}
}