中文

字符感知模型改进视觉文本渲染

计算与语言 2023-05-04 v2 计算机视觉与模式识别

摘要

当前的图像生成模型难以稳定地生成格式良好的视觉文本。在本文中,我们研究了一个关键影响因素:流行的文本到图像模型缺乏字符级输入特征,这使得将一个词的视觉构成预测为一系列字形变得困难得多。为了量化这一影响,我们进行了一系列实验,比较了字符感知与字符盲文本编码器。在纯文本领域,我们发现字符感知模型在一个新颖的拼写任务(WikiSpell)上取得了巨大的提升。将我们的学习成果应用于视觉领域,我们训练了一系列图像生成模型,并表明在一系列新颖的文本渲染任务(我们的 DrawText 基准)上,字符感知变体优于其字符盲对应物。我们的模型在视觉拼写上设定了更高的 SOTA,在罕见词上比竞争对手高出 30 多个点的准确率,尽管训练所用的样本要少得多。

关键词

引用

@article{arxiv.2212.10562,
  title  = {Character-Aware Models Improve Visual Text Rendering},
  author = {Rosanne Liu and Dan Garrette and Chitwan Saharia and William Chan and Adam Roberts and Sharan Narang and Irina Blok and RJ Mical and Mohammad Norouzi and Noah Constant},
  journal= {arXiv preprint arXiv:2212.10562},
  year   = {2023}
}