中文

TextDiffuser-RL:面向高保真文生图的高效鲁棒文本布局优化

计算机视觉与模式识别 2025-11-11 v3 人工智能

摘要

文本嵌入图像生成在平面设计、广告和数字内容创作等行业中发挥着关键作用。利用扩散模型的文生图方法,如TextDiffuser-2,在生成带有嵌入文本的图像方面展现出了可喜的成果。TextDiffuser-2有效地生成边界框布局来指导视觉文本的渲染,实现了高保真度和连贯性。然而,现有方法通常依赖资源密集型的过程,并且在CPU和GPU平台上高效运行的能力有限。为了应对这些挑战,我们提出了一种新颖的两阶段流水线,将用于快速优化文本布局生成的强化学习(RL)与基于扩散的图像合成模型相结合。我们基于RL的方法显著加速了边界框预测步骤并减少了重叠,使系统能够在CPU和GPU上高效运行。大量评估表明,我们的框架在文本放置和图像合成方面取得了与TextDiffuser-2相当的性能,同时提供了明显更快的运行速度和更高的灵活性。我们的方法生成了与TextDiffuser-2质量相当的高质量图像,但速度快42.29倍,且推理仅需2 MB的CPU RAM,而TextDiffuser-2的M1模型在纯CPU系统上无法运行。

关键词

引用

@article{arxiv.2505.19291,
  title  = {TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis},
  author = {Kazi Mahathir Rahman and Showrin Rahman and Sharmin Sultana Srishty},
  journal= {arXiv preprint arXiv:2505.19291},
  year   = {2025}
}

备注

19 pages, 36 figures