可靠的自回归式样式文本图像生成
计算机视觉与模式识别
2025-12-01 v2
摘要
生成忠实且可读的样式文本图像(尤其是样式手写文本生成 - HTG)仍是开放问题,相关研究致力于开发复现特定书写者风格特征的方法,近期提出的自回归 Transformer 方法在风格忠实度和泛化性方面取得了有希望的成果。然而,该方法需要额外输入、缺乏适当的停止机制,可能陷入重复循环,产生视觉瑕疵。本文重新构思自回归表述,将 HTG 作为多模态提示条件生成任务,通过引入特殊文本输入标记以更好地对齐视觉标记,解决内容可控性问题。此外,我们构思了基于分类器自由指导的自回归模型策略。通过大量实验验证,我们展示的该方法(称为 Eruku)相较于前述方案需要更少输入、对未见风格的泛化更好、更忠实地遵循文本提示,从而提高内容一致性。
引用
@article{arxiv.2510.23240,
title = {Autoregressive Styled Text Image Generation, but Make it Reliable},
author = {Carmine Zaccagnino and Fabio Quattrini and Vittorio Pippi and Silvia Cascianelli and Alessio Tonioni and Rita Cucchiara},
journal= {arXiv preprint arXiv:2510.23240},
year = {2025}
}
备注
Accepted at WACV2026