控制信息如何影响多语言文本图像生成与编辑?
计算机视觉与模式识别
2024-07-23 v2
摘要
视觉文本生成通过扩散模型取得了显著进展,旨在生成可读且逼真的文本图像。近期工作主要采用基于ControlNet的框架,采用标准字体文本图像来控制扩散模型。鉴于控制信息在生成高质量文本方程的关键作用,我们从三个角度探讨其影响:输入编码、不同阶段的作用以及输出特征。我们的发现表明:1)输入控制信息的独特性不同于常规输入如Canny边缘和深度图;2)控制信息在去噪过程的不同阶段发挥着不同作用;3)输出控制特征在频域中与U-Net解码器的基线特征和跳过特征显著不同。基于这些洞见,我们提出了TextGen框架,通过优化控制信息来提升生成质量。我们采用傅里叶分析改进输入和输出特征,以强化相关信息并减少噪声。此外,我们采用两阶段生成框架以协调控制信息在不同阶段的不同作用。进一步,我们引入了一个有效且轻量级的数据集用于训练。我们的方法在中英文文本生成中均实现了最先进的性能。代码和数据集已公开:https://github.com/CyrilSterling/TextGen。
引用
@article{arxiv.2407.11502,
title = {How Control Information Influences Multilingual Text Image Generation and Editing?},
author = {Boqiang Zhang and Zuan Gao and Yadong Qu and Hongtao Xie},
journal= {arXiv preprint arXiv:2407.11502},
year = {2024}
}