中文

布局无关的场景文本图像合成与扩散模型

计算机视觉与模式识别 2024-09-17 v5

摘要

尽管扩散模型显著提升了图像生成的质量,但其在图像中准确且连贯地渲染文本的能力仍然是一个重大挑战。传统的基于扩散的场景文本生成方法通常受限于对中间布局输出的依赖。这种依赖往往导致文本样式和字体多样性受限,这是由布局生成阶段的确定性本质所固有的局限性。为了解决这些挑战,本文引入了SceneTextGen,一种新颖的基于扩散的模型,专门设计用于规避对预定义布局阶段的需求。通过这样做,SceneTextGen促进了更自然和多样化的文本表示。SceneTextGen的新颖之处在于其集成了三个关键组件:一个用于捕捉详细印刷属性的字符级编码器,结合一个字符级实例分割模型和一个词级检测模型,以解决不需要的文本生成和微小字符不准确的问题。我们通过在不同公开视觉文本数据集上生成的图像上展示改进的字符识别率来验证我们方法的性能,并与标准扩散方法和文本特定方法进行比较。

关键词

引用

@article{arxiv.2406.01062,
  title  = {Layout Agnostic Scene Text Image Synthesis with Diffusion Models},
  author = {Qilong Zhangli and Jindong Jiang and Di Liu and Licheng Yu and Xiaoliang Dai and Ankit Ramchandani and Guan Pang and Dimitris N. Metaxas and Praveen Krishnan},
  journal= {arXiv preprint arXiv:2406.01062},
  year   = {2024}
}

备注

Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024, pp. 7496-7506