中文

CustomText:使用扩散模型进行定制化文本图像生成

计算机视觉与模式识别 2024-05-22 v1 机器学习

摘要

文本图像生成涵盖广告、教育、产品包装、社交媒体、信息可视化和品牌推广等多个领域。尽管近年来使用扩散模型进行语言引导的图像合成取得了进展,但当前模型在图像生成方面表现出色,但在准确文本渲染方面存在困难,并且对字体属性的控制有限。在本文中,我们旨在增强高质量图像的合成能力,实现精确的文本定制,从而为图像生成模型的进步做出贡献。我们将所提出的方法称为CustomText。我们的实现利用预训练的TextDiffuser模型来实现对字体颜色、背景和类型的控制。此外,为了解决准确渲染小字体的挑战,我们为一致性解码器训练了ControlNet模型,显著提升了文本生成性能。我们在公开的CTW-1500数据集和一个自建的小文本生成数据集上评估了CustomText的性能,与之前的文本图像生成方法相比,展示了优越的结果。

关键词

引用

@article{arxiv.2405.12531,
  title  = {CustomText: Customized Textual Image Generation using Diffusion Models},
  author = {Shubham Paliwal and Arushi Jain and Monika Sharma and Vikram Jamwal and Lovekesh Vig},
  journal= {arXiv preprint arXiv:2405.12531},
  year   = {2024}
}

备注

Accepted by AI for Content Creation (AI4CC) workshop at CVPR 2024