中文

野外场景的视觉文本生成

计算机视觉与模式识别 2024-11-05 v2

摘要

近期,随着生成模型的快速发展,视觉文本生成领域取得了显著进展。然而,在真实场景中渲染高质量文本图像仍具有挑战性,因为需要同时满足三个关键标准:(1) 忠实性:生成的文本图像应具备照片般的真实感,内容应与给定条件一致;(2) 合理性:生成的文本区域和内容应与场景协调一致;(3) 实用性:生成的文本图像可促进相关任务(如文本检测和识别)。经过调查,我们发现现有方法,无论是基于渲染的还是基于扩散的,几乎无法同时满足上述所有方面,从而限制了其应用范围。因此,本文提出了一个视觉文本生成器(称为SceneVTG),可在野外场景中生成高质量文本图像。遵循两阶段范式,SceneVTG利用多模态大语言模型在多个尺度和层次上推荐合理的文本区域和内容,这些区域和内容随后由条件扩散模型作为条件来生成文本图像。大量实验表明,所提出的SceneVTG在忠实性和合理性方面显著优于传统渲染方法和最新的扩散方法。此外,生成的图像为文本检测和文本识别任务提供了优异的实用性。代码和数据集已在AdvancedLiterateMachinery提供。

关键词

引用

@article{arxiv.2407.14138,
  title  = {Visual Text Generation in the Wild},
  author = {Yuanzhi Zhu and Jiawei Liu and Feiyu Gao and Wenyu Liu and Xinggang Wang and Peng Wang and Fei Huang and Cong Yao and Zhibo Yang},
  journal= {arXiv preprint arXiv:2407.14138},
  year   = {2024}
}

备注

Accepted to ECCV 2024