中文

StyleTextGen:风格条件多语言场景文本生成

计算机视觉与模式识别 2026-05-15 v1

摘要

风格条件场景文本生成在从复杂背景中提取精确文本风格以及保持字符间细粒度风格一致性方面面临独特挑战,对于多语言文字系统尤为如此。我们提出了 StyleTextGen,一个学习感知并复现跨不同语言和书写系统视觉文本风格的新颖框架。我们的方法包含三个关键贡献:首先,我们引入了专用于风格建模的双分支风格编码器,在复杂的真实世界场景中产生鲁棒的多语言文本风格表示。其次,我们设计了文本风格一致性损失,以增强风格连贯性并提升整体视觉质量。第三,我们开发了一种掩码引导的推理策略,确保生成文本与参考文本之间精确的风格对齐。为便于系统评估,我们构建了 StyleText-CE,一个涵盖单语和跨语言设置的双语场景文本风格基准。大量实验表明,StyleTextGen 在风格一致性和跨语言泛化方面显著优于现有方法,在多语言风格条件文本生成中确立了新的 SOTA 性能。

关键词

引用

@article{arxiv.2605.14708,
  title  = {StyleTextGen: Style-Conditioned Multilingual Scene Text Generation},
  author = {Zeyu Chen and Fangmin Zhao and Yan Shu and Yichao Liu and Liu Yu and Yu Zhou},
  journal= {arXiv preprint arXiv:2605.14708},
  year   = {2026}
}

备注

This paper has been accepted to CVPR 2026