JoyType:一种面向多语言视觉文本创建的鲁棒设计
计算机视觉与模式识别
2025-03-31 v2
摘要
生成具有精确表示文本的图像,尤其是非拉丁语系文本,对扩散模型构成了重大挑战。现有方法,例如通过辅助网络(如ControlNet)集成提示条件图,已在解决此问题上取得了进展。然而,扩散模型在需要受控文本生成的任务中往往表现不佳,例如指定特定字体或生成小号字体文本。在本文中,我们介绍了一种新颖的多语言视觉文本创建方法,名为JoyType,旨在图像生成过程中保持文本的字体风格。我们的方法首先组装一个训练数据集JoyType-1M,包含100万对数据。每对数据包括一张图像、其描述以及对应于图像内字体风格的字形指令。然后,我们开发了一个文本控制网络Font ControlNet,负责提取字体风格信息以引导图像生成。为了进一步增强模型保持字体风格的能力,尤其是在生成小字体文本时,我们在扩散过程中引入了一种多层OCR感知损失。这一增强使得JoyType能够利用低级描述符来指导文本渲染。基于视觉和准确性指标的评估表明,JoyType显著优于现有最先进的方法。此外,JoyType可以作为一个插件,与HuggingFace和CivitAI上的其他稳定扩散模型结合使用,促进多样化图像风格的创建。我们的项目已在https://jdh-algo.github.io/JoyType/上开源。
引用
@article{arxiv.2409.17524,
title = {JoyType: A Robust Design for Multilingual Visual Text Creation},
author = {Chao Li and Chen Jiang and Xiaolong Liu and Jun Zhao and Guoxin Wang},
journal= {arXiv preprint arXiv:2409.17524},
year = {2025}
}