中文

UDiffText:一种基于字符感知扩散模型的任意图像高质量文本合成统一框架

计算机视觉与模式识别 2023-12-27 v1

摘要

基于扩散模型的文本到图像(T2I)生成方法在过去几年中引起了广泛关注。尽管这些图像合成方法能产生视觉上吸引人的结果,但在生成图像内渲染文本时,它们经常出现拼写错误。这些错误表现为字符缺失、错误或多余,从而严重限制了基于扩散模型的文本图像生成性能。为了解决上述问题,本文提出了一种新颖的文本图像生成方法,利用预训练的扩散模型(即 Stable Diffusion [27])。我们的方法涉及设计和训练一个轻量级的字符级文本编码器,该编码器替代了原始的 CLIP 编码器,并提供更鲁棒的文本嵌入作为条件引导。然后,我们使用大规模数据集对扩散模型进行微调,并在字符级分割图的监督下引入局部注意力控制。最后,通过采用推理阶段的细化过程,我们在任意给定图像中合成文本时实现了显著高的序列准确率。定性和定量结果均证明了我们的方法相对于现有技术的优越性。此外,我们展示了所提出的 UDiffText 的几个潜在应用,包括以文本为中心的图像合成、场景文本编辑等。代码和模型将在 https://github.com/ZYM-PKU/UDiffText 上提供。

关键词

引用

@article{arxiv.2312.04884,
  title  = {UDiffText: A Unified Framework for High-quality Text Synthesis in Arbitrary Images via Character-aware Diffusion Models},
  author = {Yiming Zhao and Zhouhui Lian},
  journal= {arXiv preprint arXiv:2312.04884},
  year   = {2023}
}

备注

17 pages