中文

AnyText2:可自定义属性的视觉文本生成与编辑

计算机视觉与模式识别 2024-11-26 v1

摘要

随着文本到图像 (T2I) 领域的进步,生成能够自然融合于视觉内容的文本已引起广泛关注。然而,即便文本生成准确,若无法控制字体和颜色,仍会大大限制某些应用,而这一问题尚未得到充分解决。本文介绍 AnyText2,一种新型方法,使其能够精确控制自然场景图像生成和编辑中多语言文本属性。我们的方法包含两个主要组成部分:第一,我们提出了 WriteNet+AttnX 架构,将文本渲染能力注入预训练的 T2I 模型。与其前身 AnyText 相比,我们的新方法不仅提升了图像真实性,还实现了 19.8% 的推理速度提升。第二,我们探索了从场景图像中提取字体和颜色的技术,并开发了文本嵌入模块,将这些文本属性分别编码为条件。作为 AnyText 的扩展,此方法允许为每一行文本自定义属性,分别实现中文和英文文本准确率提升 3.3% 和 9.3%。通过全面实验,我们展示了本方法的前沿性能。代码和模型将在 https://github.com/tyxsspa/AnyText2 上开源。

关键词

引用

@article{arxiv.2411.15245,
  title  = {AnyText2: Visual Text Generation and Editing With Customizable Attributes},
  author = {Yuxiang Tuo and Yifeng Geng and Liefeng Bo},
  journal= {arXiv preprint arXiv:2411.15245},
  year   = {2024}
}