GlyphDiffusion:将文本生成视为图像生成
计算与语言
2023-05-09 v2 计算机视觉与模式识别
机器学习
摘要
扩散模型已成为文本生成的一种新生成范式。考虑到文本的离散类别性质,本文提出 GlyphDiffusion,一种通过文本引导图像生成实现文本生成的新型扩散方法。我们的核心思想是将目标文本渲染为包含视觉语言内容的字形图像。这样一来,条件文本生成可转化为字形图像生成任务,从而自然地将连续扩散模型应用于离散文本。具体而言,我们利用级联架构(即一个基础扩散模型和一个超分辨率扩散模型),以输入文本为条件生成高保真字形图像。此外,我们设计了一个文本定位模块,将生成字形图像中的视觉语言内容转换并精炼为最终文本。在四个条件文本生成任务和两类指标(即质量与多样性)的实验中,GlyphDiffusion 能够取得与多个基线(包括预训练语言模型)相当甚至更优的结果。与近期扩散模型相比,我们的模型也有显著提升。
引用
@article{arxiv.2304.12519,
title = {GlyphDiffusion: Text Generation as Image Generation},
author = {Junyi Li and Wayne Xin Zhao and Jian-Yun Nie and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2304.12519},
year = {2023}
}
备注
working in progress