TextDiffuser-2:释放语言模型在文本渲染中的能力
计算机视觉与模式识别
2023-11-29 v1
摘要
扩散模型近年已被证明是一种强大的生成模型,但在生成视觉文本方面仍存在挑战。若干方法通过将显式的文本位置与内容作为在何处及渲染何种文本的引导来缓解此问题。然而,这些方法仍存在一些缺陷,如灵活性与自动化有限、布局预测能力受限以及风格多样性不足。本文中,我们提出TextDiffuser-2,旨在释放语言模型用于文本渲染的能力。首先,我们微调一个大语言模型用于布局规划。该大语言模型能够自动生成用于文本渲染的关键词,并支持通过对话修改布局。其次,我们在扩散模型内利用语言模型对行级的位置与文本进行编码。与先前采用紧凑字符级引导的方法不同,该方法生成更具多样性的文本图像。我们进行了大量实验并引入涉及人类参与者及GPT-4V的用户研究,验证了TextDiffuser-2实现更合理文本布局与增强多样性生成的能力。代码与模型将发布于\url{https://aka.ms/textdiffuser-2}。
引用
@article{arxiv.2311.16465,
title = {TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering},
author = {Jingye Chen and Yupan Huang and Tengchao Lv and Lei Cui and Qifeng Chen and Furu Wei},
journal= {arXiv preprint arXiv:2311.16465},
year = {2023}
}