通过分解真实世界数据学习实现的场景文本合成引擎
计算机视觉与模式识别
2023-10-18 v2
摘要
旨在将文本实例自然合成到背景场景图像上的场景文本图像合成技术,因能提供准确全面的标注信息,对训练深度神经网络极具吸引力。先前研究已探索利用从真实世界观察中得出的规则在二维和三维表面上生成合成文本图像。其中部分研究提出通过学习方法生成场景文本图像;然而,由于缺乏合适的训练数据集,已探索从无监督框架中从现有真实世界数据学习,这可能无法产生可靠性能。为缓解此困境并推动基于学习的场景文本合成研究,我们引入 DecompST,一个从若干公开基准 prepared 的真实世界数据集,包含三类标注:四边形级边界框、笔画级文本掩码和去文本图像。利用 DecompST 数据集,我们提出一种基于学习的文本合成引擎(LBTS),包含文本位置提议网络(TLPNet)和文本外观适配网络(TAANet)。TLPNet 首先预测适合文本嵌入的区域,随后 TAANet 自适应调整文本实例的几何与颜色以匹配背景上下文。训练后,这些网络可集成并用于生成场景文本分析任务的合成数据集。我们进行了全面实验以验证所提 LBTS 与现有方法的有效性,实验结果表明所提 LBTS 能为场景文本检测器生成更好的预训练数据。
引用
@article{arxiv.2209.02397,
title = {A Scene-Text Synthesis Engine Achieved Through Learning from Decomposed Real-World Data},
author = {Zhengmi Tang and Tomo Miyazaki and Shinichiro Omachi},
journal= {arXiv preprint arXiv:2209.02397},
year = {2023}
}