中文

可靠的自回归式样式文本图像生成

计算机视觉与模式识别 2025-12-01 v2

摘要

生成忠实且可读的样式文本图像(尤其是样式手写文本生成 - HTG)仍是开放问题,相关研究致力于开发复现特定书写者风格特征的方法,近期提出的自回归 Transformer 方法在风格忠实度和泛化性方面取得了有希望的成果。然而,该方法需要额外输入、缺乏适当的停止机制,可能陷入重复循环,产生视觉瑕疵。本文重新构思自回归表述,将 HTG 作为多模态提示条件生成任务,通过引入特殊文本输入标记以更好地对齐视觉标记,解决内容可控性问题。此外,我们构思了基于分类器自由指导的自回归模型策略。通过大量实验验证,我们展示的该方法(称为 Eruku)相较于前述方案需要更少输入、对未见风格的泛化更好、更忠实地遵循文本提示,从而提高内容一致性。

关键词

引用

@article{arxiv.2510.23240,
  title  = {Autoregressive Styled Text Image Generation, but Make it Reliable},
  author = {Carmine Zaccagnino and Fabio Quattrini and Vittorio Pippi and Silvia Cascianelli and Alessio Tonioni and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2510.23240},
  year   = {2025}
}

备注

Accepted at WACV2026