中文

ARTIST:通过解耦扩散模型和大语言模型提升文本丰富图像生成

计算机视觉与模式识别 2024-12-03 v3

摘要

扩散模型已在生成广泛视觉内容方面展现出卓越能力,但其在渲染文本方面的专业性仍有限:它们常常生成不准确的字符或单词,且难以与底层图像良好融合。为解决这些不足,我们提出一种新框架,称为 ARTIST,集成专门的文本扩散模型,以专注于文本结构的学习。初始阶段,我们预训练此文本模型以捕捉文本表示的细节。随后,我们微调视觉扩散模型,使其能够吸收预训练文本模型中学习到的文本结构信息。这种解耦的架构设计和训练策略显著增强了扩散模型在文本丰富图像生成中的文本渲染能力。此外,我们利用预训练大语言模型的能力来更好地解释用户意图,从而提升生成质量。在 MARIO-Eval 基准测试上的实证结果凸显了所提方法的有效性,在各种指标上实现了最高可达 15% 的提升。

关键词

引用

@article{arxiv.2406.12044,
  title  = {ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models},
  author = {Jianyi Zhang and Yufan Zhou and Jiuxiang Gu and Curtis Wigington and Tong Yu and Yiran Chen and Tong Sun and Ruiyi Zhang},
  journal= {arXiv preprint arXiv:2406.12044},
  year   = {2024}
}

备注

Accepted to WACV 2025