用于高效且有效的深度网络训练的场景文本合成
计算机视觉与模式识别
2023-04-25 v3
摘要
大量带标注的训练图像对于训练准确且鲁棒的深度网络模型至关重要,但收集大量带标注的训练图像通常耗时且昂贵。图像合成通过由机器自动生成带标注的训练图像来缓解这一限制,在最近的深度学习研究中引起了越来越多的关注。我们开发了一种创新的图像合成技术,通过将感兴趣前景目标(OOI)真实地嵌入背景图像来合成带标注的训练图像。所提出的技术由两个关键组件构成,原则上提升了合成图像在深度网络训练中的有用性。其一是上下文感知的语义连贯性,确保OOI被放置在背景图像内语义连贯的区域附近。其二是和谐的外观适配,确保嵌入的OOI在几何对齐与外观真实感两方面都与周围背景相协调。所提出的技术已在两个相关但差异很大的计算机视觉挑战上进行了评估,即场景文本检测与场景文本识别。在多个公开数据集上的实验证明了我们提出的图像合成技术的有效性——在深度网络训练中使用我们的合成图像能够达到与使用该真实图像相似甚至更好的场景文本检测与场景文本识别性能。
引用
@article{arxiv.1901.09193,
title = {Scene Text Synthesis for Efficient and Effective Deep Network Training},
author = {Changgong Zhang and Fangneng Zhan and Hongyuan Zhu and Shijian Lu},
journal= {arXiv preprint arXiv:1901.09193},
year = {2023}
}
备注
This work has been merged into another project