中文

面向零样本 styled 文本图像生成的自回归方法

计算机视觉与模式识别 2025-03-25 v2

摘要

样式手写文本生成(HTG)最近受到计算机视觉和文档分析社区的关注,这些社区开发了若干解决方案,采用 GAN 或扩散方法,取得了令人鼓舞的效果。然而,这些方法难以泛化到新样式,且在输出长度和训练效率方面存在技术限制。为克服这些限制,本文提出一种新型文本图像生成框架,命名为 Emuru。我们的方法结合强大的文本图像表示模型(变分自编码器)和自回归 Transformer。该方法能够在文本内容和样式示例(如特定字体或手写体)条件下生成样式化文本图像。我们仅使用由超过 10 万种排印和书法字体渲染的多样化合成英文文本数据集进行训练,使其能够在零样本情况下复现未见样式(包括字体和用户手写体)。据我们了解,Emuru 是首个用于 HTG 的自回归模型,也是首个专为泛化到新样式而设计的模型。此外,我们的模型在生成图像时不会产生背景杂物,下游应用更为便捷。在涵盖排印和手写体、任意长度文本图像生成的广泛评估中,结果表明我们方法有效。

关键词

引用

@article{arxiv.2503.17074,
  title  = {Zero-Shot Styled Text Image Generation, but Make It Autoregressive},
  author = {Vittorio Pippi and Fabio Quattrini and Silvia Cascianelli and Alessio Tonioni and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2503.17074},
  year   = {2025}
}

备注

Accepted at CVPR2025