中文

GlyphDiffusion:将文本生成视为图像生成

计算与语言 2023-05-09 v2 计算机视觉与模式识别 机器学习

摘要

扩散模型已成为文本生成的一种新生成范式。考虑到文本的离散类别性质,本文提出 GlyphDiffusion,一种通过文本引导图像生成实现文本生成的新型扩散方法。我们的核心思想是将目标文本渲染为包含视觉语言内容的字形图像。这样一来,条件文本生成可转化为字形图像生成任务,从而自然地将连续扩散模型应用于离散文本。具体而言,我们利用级联架构(即一个基础扩散模型和一个超分辨率扩散模型),以输入文本为条件生成高保真字形图像。此外,我们设计了一个文本定位模块,将生成字形图像中的视觉语言内容转换并精炼为最终文本。在四个条件文本生成任务和两类指标(即质量与多样性)的实验中,GlyphDiffusion 能够取得与多个基线(包括预训练语言模型)相当甚至更优的结果。与近期扩散模型相比,我们的模型也有显著提升。

关键词

引用

@article{arxiv.2304.12519,
  title  = {GlyphDiffusion: Text Generation as Image Generation},
  author = {Junyi Li and Wayne Xin Zhao and Jian-Yun Nie and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2304.12519},
  year   = {2023}
}

备注

working in progress