中文

OCR-VQGAN:驯服图像内文本生成

计算机视觉与模式识别 2022-10-26 v2

摘要

合成图像生成近来在自然图像或艺术生成等领域取得了显著进展。然而,图形与图表生成问题仍未被探索。生成图形与图表的一个挑战性方面是在图像中有效渲染可读文本。为缓解此问题,我们提出OCR-VQGAN,一种利用OCR预训练特征来优化文本感知损失的图像编码器与解码器,促使架构保留高保真文本与图表结构。为探索我们的方法,我们引入了Paper2Fig100k数据集,包含超过10万张来自研究论文的图形与文本图像。这些图形展示了arXiv.org上可用文章(来自人工智能和计算机视觉等领域)的架构图与方法论。图形通常包含文本与离散对象(如图中的方框),以及连接它们的线与箭头。我们通过在图形重建任务上进行若干实验证明了OCR-VQGAN的有效性。此外,我们探讨了在总体损失函数中加权不同感知度量的定性与定量影响。我们在 https://github.com/joanrod/ocr-vqgan 发布了代码、模型与数据集。

关键词

引用

@article{arxiv.2210.11248,
  title  = {OCR-VQGAN: Taming Text-within-Image Generation},
  author = {Juan A. Rodriguez and David Vazquez and Issam Laradji and Marco Pedersoli and Pau Rodriguez},
  journal= {arXiv preprint arXiv:2210.11248},
  year   = {2022}
}

备注

Paper accepted at WACV 2023