面向高保真多语言场景文本合成的 OCR-Free DiT 模型 TextFlux
计算机视觉与模式识别
2026-03-13 v2
摘要
基于扩散的场景文本合成研究迅速发展,但现有方法常依赖额外的视觉条件模块,且需要大规模标注数据以支持多语言生成。本文重新审视复杂辅助模块的必要性,进而探索一种同时确保字形准确性并实现高保真场景集成的方法,利用扩散模型内在的上下文推理能力。为此,我们引入 TextFlux,一个基于 DiT 的框架,实现多语言场景文本合成。TextFlux 的优势可归纳如下:(1)无 OCR 模型架构。TextFlux 消除了无需 OCR 编码器(额外的视觉条件模块),这些模块专用于提取与文本相关的视觉特征。(2)强大的多语言可扩展性。TextFlux 在低资源多语言设置中有效,对新加入语言的性能强劲,即使仅使用不到 1000 个样本。(3)简化的训练设置。TextFlux 只需使用竞争方法所需训练数据的 1%。(4)可控的多行文本生成。TextFlux 提供灵活的多行合成,支持精确的行级控制,优于仅限单行或刚性布局的方法。广泛的实验和可视化结果表明,TextFlux 在定性和定量评估方面均优于先前方法。
引用
@article{arxiv.2505.17778,
title = {TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis},
author = {Yu Xie and Jielei Zhang and Pengyu Chen and Weihang Wang and Longwen Gao and Peiyi Li and Qian Qiao and Zhouhui Lian},
journal= {arXiv preprint arXiv:2505.17778},
year = {2026}
}
备注
Accepted to Eurographics 2026 (Computer Graphics Forum)