中文

从死像素到可编辑幻灯片:通过视觉-语言区域理解实现信息图重构为原生Google Slides

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

信息图以文本、图标和数据可视化的组合方式广泛用于信息传递,但一旦导出为图像,其内容就被锁定在像素中,导致更新、本地化和重用的成本高昂。我们描述了Images2Slides系统,将静态信息图(PNG/JPG)转换为原生可编辑Google Slides幻灯片,通过提取区域级别的规格,从像素几何映射到幻灯片坐标,并使用Google Slides批量更新API重建元素。该系统模型中立,支持通过统一JSON区域模式和确定性后处理的多个视觉-语言模型后端。我们在由29个程序化生成信息图幻灯片组成的受控基准上测试,实现整体元素恢复率为0.989±0.0570.989\pm0.057(文本:0.985±0.0830.985\pm0.083,图像:1.000±0.0001.000\pm0.000),文本转录误差均值为CER=0.033±0.149\mathrm{CER}=0.033\pm0.149,文本区域布局保真度均值为IoU=0.364±0.161\mathrm{IoU}=0.364\pm0.161,图像区域布局保真度均值为0.644±0.1310.644\pm0.131。我们还概述了重建中的实际工程挑战,包括文本大小校准和非均匀背景,并描述引导未来工作的失效模式。

关键词

引用

@article{arxiv.2602.07645,
  title  = {From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding},
  author = {Leonardo Gonzalez},
  journal= {arXiv preprint arXiv:2602.07645},
  year   = {2026}
}

备注

Accepted for publication in the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), April 13-17, 2026, Dubai, United Arab Emirates