GlyphControl:用于视觉文本生成的字形条件控制
计算机视觉与模式识别
2023-11-14 v2
摘要
近来,开发能够生成连贯且规整视觉文本、基于扩散(diffusion)的文本到图像生成模型日益受到关注。本文中,我们提出一种新颖且高效的方法称为GlyphControl来解决该任务。与依赖像ByT5这类字符感知文本编码器并需重新训练文本到图像模型的现有方法不同,我们的方法利用额外的字形条件信息来增强现成Stable-Diffusion模型在生成准确视觉文本上的性能。通过融入字形指令,用户可根据其特定需求定制生成文本的内容、位置与大小。为促进视觉文本生成的进一步研究,我们构建了名为LAION-Glyph的训练基准数据集。我们通过测量基于OCR的指标、CLIP分数以及生成视觉文本的FID来评估我们方法的有效性。我们的实证评估表明,GlyphControl在OCR准确率、CLIP分数与FID方面优于近期的DeepFloyd IF方法,凸显了我们方法的有效性。
引用
@article{arxiv.2305.18259,
title = {GlyphControl: Glyph Conditional Control for Visual Text Generation},
author = {Yukang Yang and Dongnan Gui and Yuhui Yuan and Weicong Liang and Haisong Ding and Han Hu and Kai Chen},
journal= {arXiv preprint arXiv:2305.18259},
year = {2023}
}
备注
Accepted by NeurIPS 2023. The codes have been released at https://github.com/AIGText/GlyphControl-release