从死像素到可编辑幻灯片:通过视觉-语言区域理解实现信息图重构为原生Google Slides
计算机视觉与模式识别
2026-02-10 v1 人工智能
摘要
信息图以文本、图标和数据可视化的组合方式广泛用于信息传递,但一旦导出为图像,其内容就被锁定在像素中,导致更新、本地化和重用的成本高昂。我们描述了Images2Slides系统,将静态信息图(PNG/JPG)转换为原生可编辑Google Slides幻灯片,通过提取区域级别的规格,从像素几何映射到幻灯片坐标,并使用Google Slides批量更新API重建元素。该系统模型中立,支持通过统一JSON区域模式和确定性后处理的多个视觉-语言模型后端。我们在由29个程序化生成信息图幻灯片组成的受控基准上测试,实现整体元素恢复率为(文本:,图像:),文本转录误差均值为,文本区域布局保真度均值为,图像区域布局保真度均值为。我们还概述了重建中的实际工程挑战,包括文本大小校准和非均匀背景,并描述引导未来工作的失效模式。
引用
@article{arxiv.2602.07645,
title = {From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding},
author = {Leonardo Gonzalez},
journal= {arXiv preprint arXiv:2602.07645},
year = {2026}
}
备注
Accepted for publication in the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), April 13-17, 2026, Dubai, United Arab Emirates