SceneVTG++:野外可控多语言视觉文本生成
计算机视觉与模式识别
2025-01-08 v2
摘要
生成自然场景图像中的视觉文本是一项具有挑战性的任务,存在许多未解决的问题。与在人工设计的图像(如海报、封面、卡通等)上生成文本不同,自然场景图像中的文本需要满足以下四个关键标准:(1) 保真度:生成的文本应像照片一样真实且完全准确,任何笔画都不能有错误。(2) 合理性:文本应生成在合理的载体区域(如板子、标志、墙壁等),并且生成的文本内容也应与场景相关。(3) 实用性:生成的文本有助于自然场景OCR(光学字符识别)任务的训练。(4) 可控性:文本的属性(如字体和颜色)应根据需要可控。在本文中,我们提出了一种两阶段方法SceneVTG++,同时满足上述四个方面。SceneVTG++由文本布局和内容生成器(TLCG)和可控局部文本扩散(CLTD)组成。前者利用多模态大语言模型的世界知识,根据自然场景背景图像找到合理的文本区域并推荐文本内容,而后者基于扩散模型生成可控的多语言文本。通过大量实验,我们分别验证了TLCG和CLTD的有效性,并证明了SceneVTG++的最先进文本生成性能。此外,生成的图像在文本检测和文本识别等OCR任务中具有优越的实用性。代码和数据集将公开。
引用
@article{arxiv.2501.02962,
title = {SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild},
author = {Jiawei Liu and Yuanzhi Zhu and Feiyu Gao and Zhibo Yang and Peng Wang and Junyang Lin and Xinggang Wang and Wenyu Liu},
journal= {arXiv preprint arXiv:2501.02962},
year = {2025}
}