DreamText:高保真场景文本合成
计算机视觉与模式识别
2025-03-25 v5 人工智能
摘要
场景文本合成涉及将指定文本渲染到任意图像上。当前方法通常以端到端的方式来完成此任务,但在训练过程中缺乏有效的字符级指导。此外,这些方法的文本编码器预训练于单一字体类型,难以适应实际应用中遇到的多样化字体样式。因此,这些方法在多样式场景下会出现字符变形、重复和缺失的问题。为此,本文提出 DreamText 实现高保真场景文本合成。我们的核心思想是重构扩散训练过程,引入更精细的指导以适应此任务,从而暴露并纠正模型在字符级别的注意力,强化其对文本区域的学习。这种转换提出了一种混合优化挑战,涉及离散变量和连续变量。为有效解决此挑战,我们采用启发式交替优化策略。同时,我们联合训练文本编码器和生成器,以全面学习和利用训练数据集中呈现的多样化字体。这种联合训练无缝集成到交替优化过程中,促进了字符嵌入学习与字符注意力重估之间的协同关系。在每一步中,我们首先将潜在字符生成位置信息从交叉注意力图编码为字符掩码。然后利用这些掩码来更新当前步骤中特定字符的表示,从而使生成器能够在后续步骤中纠正字符的注意力。定性和定量结果均表明我们的方法在状态突破方法方面具有优势。
引用
@article{arxiv.2405.14701,
title = {DreamText: High Fidelity Scene Text Synthesis},
author = {Yibin Wang and Weizhong Zhang and Honghui Xu and Cheng Jin},
journal= {arXiv preprint arXiv:2405.14701},
year = {2025}
}
备注
Code: https://github.com/CodeGoat24/DreamText, Project page: https://codegoat24.github.io/DreamText/