TextSSR:基于扩散模型的场景文本识别数据合成方法
计算机视觉与模式识别
2025-09-11 v2
摘要
场景文本识别(STR)面临数据质量不足或难以收集大量真实数据等挑战,限制了训练模型的效果。尽管扩散基方法能够生成整体逼真的文本图像,但在大规模生成准确且真实的实例级文本方面仍存在困难。为此,我们提出TextSSR:一种用于场景文本识别训练数据合成的新型流程。TextSSR聚焦三个关键合成特性:准确性、真实性和可扩展性。通过提出的区域导向文本生成方法结合位置-字形增强,实现字符的准确 placement。通过利用周围文本或背景的语境线索引导风格和外观生成,保持真实性。该字符感知扩散架构实现精确的字符级控制和语义一致性,无需依赖自然语言提示。因此,TextSSR支持通过文本排列的组合实现大规模生成。基于此,我们构建了TextSSR-F数据集,包含355万个经质量筛选的文本实例。大量实验表明,使用TextSSR-F训练的STR模型在常用基准测试上均显著优于现有合成数据集,混合真实数据进一步提升效果。代码已公开:https://github.com/YesianRohn/TextSSR。
引用
@article{arxiv.2412.01137,
title = {TextSSR: Diffusion-based Data Synthesis for Scene Text Recognition},
author = {Xingsong Ye and Yongkun Du and Yunbo Tao and Zhineng Chen},
journal= {arXiv preprint arXiv:2412.01137},
year = {2025}
}
备注
Accepted by ICCV 2025