TextDiffuser:作为文本绘制者的扩散模型
计算机视觉与模式识别
2023-10-31 v5
摘要
扩散模型因其令人惊叹的生成能力而受到越来越多的关注,但目前难以渲染准确且连贯的文本。为解决此问题,我们引入TextDiffuser,专注于生成与背景连贯且视觉吸引人的带文本图像。TextDiffuser包含两阶段:首先,一个Transformer模型从文本提示中提取关键词并生成其布局,随后扩散模型以文本提示与所生成布局为条件生成图像。此外,我们贡献了首个带OCR标注的大规模文本图像数据集MARIO-10M,包含1000万图文对,具有文本识别、检测及字符级分割标注。我们进一步收集MARIO-Eval基准作为评估文本渲染质量的综合工具。通过实验与用户研究,我们表明TextDiffuser灵活可控,可仅使用文本提示或结合文本模板图像创建高质量文本图像,并执行文本修复以重建不完整的带文本图像。代码、模型与数据集将发布于\url{https://aka.ms/textdiffuser}。
引用
@article{arxiv.2305.10855,
title = {TextDiffuser: Diffusion Models as Text Painters},
author = {Jingye Chen and Yupan Huang and Tengchao Lv and Lei Cui and Qifeng Chen and Furu Wei},
journal= {arXiv preprint arXiv:2305.10855},
year = {2023}
}
备注
NeurIPS 2023