中文

WordCon:场景文本渲染中的单词级排版控制

计算机视觉与模式识别 2025-06-27 v1

摘要

在生成图像中实现精确的单词级排版控制仍是一个持续的挑战。为此,我们构建了一个单词级受控场景文本数据集,并引入Text-Image Alignment(TIA)框架。该框架利用 grounding模型提供的文本与局部图像区域之间的跨模态对应关系,以增强Text-to-Image模型的训练。此外,我们提出了WordCon,一种混合参数高效微调(PEFT)方法。WordCon对选择性关键参数进行再参数化,提高了效率和可移植性。这使得其无缝集成到多样化的管道中,包括艺术文本渲染、文本编辑和图像条件文本渲染。为进一步增强可控性,应用潜在层面的掩码损失以指导模型专注于学习图像中的文本区域,联合注意力损失提供特征级监督以促进不同单词之间的解耦。定性和定量结果均显示我们的方法优于现有技术。该数据集和源代码将用于学术用途。

关键词

引用

@article{arxiv.2506.21276,
  title  = {WordCon: Word-level Typography Control in Scene Text Rendering},
  author = {Wenda Shi and Yiren Song and Zihan Rao and Dengming Zhang and Jiaming Liu and Xingxing Zou},
  journal= {arXiv preprint arXiv:2506.21276},
  year   = {2025}
}