中文

先创建背景再渲染文本:一种新的视觉文本混合范式

计算机视觉与模式识别 2024-10-15 v1

摘要

扩散模型因其卓越的图像生成能力而在视觉文本生成领域占据重要地位。然而,现有的视觉文本生成方法往往侧重于使用文本提示生成完整图像,导致控制不够精确且实际应用受限。更具前景的方向是视觉文本混合,其关注于将文本无缝地融合到无文本背景上。然而,现有的视觉文本混合方法常因背景数据不足和泛化能力有限,难以生成高保真且多样化的图像。为此,我们提出一种新的视觉文本混合范式,包括背景创建和文本渲染两个步骤。具体而言,开发了一个背景生成器,用于生成高保真且无文本的自然图像。此外,设计了一个名为 GlyphOnly 的文本渲染器,以实现视觉上可信的文本与背景集成。GlyphOnly 基于 Stable Diffusion 框架构建,利用字形和背景作为条件,实现精准的渲染和一致性控制,并配备了用于小尺度文本渲染的自适应文本块探索策略。我们还基于本方法探索了若干下游应用,包括用于提升场景文本检测器性能的场景文本数据集合成,以及文本图像的定制化和编辑。代码和模型将在 \url{https://github.com/Zhenhang-Li/GlyphOnly} 提供。

关键词

引用

@article{arxiv.2410.10168,
  title  = {First Creating Backgrounds Then Rendering Texts: A New Paradigm for Visual Text Blending},
  author = {Zhenhang Li and Yan Shu and Weichao Zeng and Dongbao Yang and Yu Zhou},
  journal= {arXiv preprint arXiv:2410.10168},
  year   = {2024}
}

备注

Accepted to ECAI2024