中文

UnrealText:从虚拟世界合成逼真场景文本图像

计算机视觉与模式识别 2020-08-19 v6

摘要

合成数据一直是训练场景文本检测与识别模型的关键工具。一方面,合成词图像已被证明可成功替代真实图像来训练场景文本识别器。另一方面,场景文本检测器仍严重依赖大量人工标注的真实世界图像,而这类图像成本高昂。本文中,我们介绍 UnrealText,一种通过 3D 图形引擎渲染逼真图像的高效图像合成方法。3D 合成引擎通过将场景与文本作为整体进行渲染来提供逼真外观,并借助精确的场景信息(如法线乃至对象网格)实现更好的文本区域提议。综合实验验证了其在场景文本检测与识别上的有效性。我们还生成了多语言版本,以供未来多语言场景文本检测与识别研究使用。此外,我们以区分大小写的方式重新标注了场景文本识别数据集,并包含标点符号以进行更全面的评估。代码与生成的数据集发布于:https://github.com/Jyouhou/UnrealText/ 。

关键词

引用

@article{arxiv.2003.10608,
  title  = {UnrealText: Synthesizing Realistic Scene Text Images from the Unreal World},
  author = {Shangbang Long and Cong Yao},
  journal= {arXiv preprint arXiv:2003.10608},
  year   = {2020}
}

备注

adding experiments with Mask-RCNN