ControlText:无需字体标注即可在多语言文本渲染中实现可控字体
计算机视觉与模式识别
2025-10-28 v2 人工智能
计算与语言
多媒体
摘要
本工作展示了扩散模型仅使用原始图像(无需字体标签标注)即可实现字体可控的多语言文本渲染。视觉文本渲染仍然是一个重大挑战。虽然近期方法以字形为条件进行扩散处理,但从大规模真实世界数据集中检索精确的字体标注是不可能的,这阻碍了用户指定的字体控制。为此,我们提出了一种数据驱动的解决方案,将条件扩散模型与文本分割模型相结合,利用分割掩码在像素空间中以自监督方式捕获和表示字体,从而消除了对任何真实标签的需求,并使用户能够使用任何他们选择的多语言字体自定义文本渲染。实验提供了我们算法在多样字体和语言上进行零样本文本和字体编辑的概念验证,为社区和行业实现通用视觉文本渲染提供了有价值的见解。代码可在github.com/bowen-upenn/ControlText获取。
引用
@article{arxiv.2502.10999,
title = {ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations},
author = {Bowen Jiang and Yuan Yuan and Xinyi Bai and Zhuoqun Hao and Alyson Yin and Yaojie Hu and Wenyu Liao and Lyle Ungar and Camillo J. Taylor},
journal= {arXiv preprint arXiv:2502.10999},
year = {2025}
}
备注
The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP) Findings