中文

GlyphDraw:在文本到图像生成中无缝渲染具有复杂空间结构的文字

计算机视觉与模式识别 2023-05-24 v2

摘要

近年来语言引导图像生成领域的突破取得了令人瞩目的成就,能够基于用户指令创建高质量且多样的图像。尽管合成性能令人惊叹,当前图像生成模型的一个显著局限是其在图像中连贯生成文字的能力不足,尤其是对于像汉字这样复杂的字形结构。为解决该问题,我们提出 GlyphDraw,一个通用学习框架,旨在赋予图像生成模型以任意特定语言连贯嵌入文字生成图像的能力。我们首先精巧地设计图像-文本数据集的构建策略,然后基于扩散(diffusion)图像生成器具体构建模型,并仔细修改网络结构,使模型借助字形与位置信息学习绘制语言字符。此外,我们通过使用参数高效微调技术防止灾难性遗忘,从而保持模型的开放域图像合成能力。大量定性与定量实验表明,我们的方法不仅能生成提示中准确的语言字符,还能将生成的文字无缝融入背景。请参考我们的 \href{https://1073521013.github.io/glyph-draw.github.io/}{项目页面}。\end{abstract}

关键词

引用

@article{arxiv.2303.17870,
  title  = {GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation},
  author = {Jian Ma and Mingjun Zhao and Chen Chen and Ruichen Wang and Di Niu and Haonan Lu and Xiaodong Lin},
  journal= {arXiv preprint arXiv:2303.17870},
  year   = {2023}
}

备注

24 pages, 5 figures