OCR-VQGAN:驯服图像内文本生成
计算机视觉与模式识别
2022-10-26 v2
摘要
合成图像生成近来在自然图像或艺术生成等领域取得了显著进展。然而,图形与图表生成问题仍未被探索。生成图形与图表的一个挑战性方面是在图像中有效渲染可读文本。为缓解此问题,我们提出OCR-VQGAN,一种利用OCR预训练特征来优化文本感知损失的图像编码器与解码器,促使架构保留高保真文本与图表结构。为探索我们的方法,我们引入了Paper2Fig100k数据集,包含超过10万张来自研究论文的图形与文本图像。这些图形展示了arXiv.org上可用文章(来自人工智能和计算机视觉等领域)的架构图与方法论。图形通常包含文本与离散对象(如图中的方框),以及连接它们的线与箭头。我们通过在图形重建任务上进行若干实验证明了OCR-VQGAN的有效性。此外,我们探讨了在总体损失函数中加权不同感知度量的定性与定量影响。我们在 https://github.com/joanrod/ocr-vqgan 发布了代码、模型与数据集。
引用
@article{arxiv.2210.11248,
title = {OCR-VQGAN: Taming Text-within-Image Generation},
author = {Juan A. Rodriguez and David Vazquez and Issam Laradji and Marco Pedersoli and Pau Rodriguez},
journal= {arXiv preprint arXiv:2210.11248},
year = {2022}
}
备注
Paper accepted at WACV 2023