中文

SynthText3D:从三维虚拟世界合成场景文本图像

计算机视觉与模式识别 2020-12-24 v2

摘要

随着深度神经网络的发展,对大量标注训练数据的需求成为许多研究和应用领域的性能瓶颈。图像合成可以自动且自由地生成标注图像,近期受到越来越多的关注。在本文中,我们提出从三维虚拟世界合成场景文本图像,其中提供了对场景的精确描述、可编辑的光照/可见性以及真实的物理特性。与以往将渲染的文本粘贴到静态二维图像上的方法不同,我们的方法可以将三维虚拟场景和文本实例作为一个整体进行渲染。这样,真实世界的变化,包括复杂的透视变换、各种光照和遮挡,都可以在我们的合成场景文本图像中实现。此外,通过随机移动和旋转充当人眼的虚拟相机,可以产生具有不同视点的相同文本实例。在标准场景文本检测基准上使用生成的合成数据进行的实验证明了所提方法的有效性和优越性。代码和合成数据可在以下网址获取:https://github.com/MhLiao/SynthText3D

关键词

引用

@article{arxiv.1907.06007,
  title  = {SynthText3D: Synthesizing Scene Text Images from 3D Virtual Worlds},
  author = {Minghui Liao and Boyu Song and Shangbang Long and Minghang He and Cong Yao and Xiang Bai},
  journal= {arXiv preprint arXiv:1907.06007},
  year   = {2020}
}

备注

Accepted by SCIS