中文

用于实时自然场景文本处理的二值卷积编码器-解码器网络

计算机视觉与模式识别 2016-12-13 v1

摘要

在本文中,我们开发了一种用于自然场景文本处理(NSTP)的二值卷积编码器-解码器网络(B-CEDNet)。它将文本图像转换为类别区分的显著性图,以揭示字符的类别、空间和形态信息。现有的解决方案要么消耗大量内存,要么运行时间过长,无法应用于资源受限设备(如高级驾驶辅助系统)上的实时应用。所开发的网络可以通过一次前向操作处理包含字符的多个区域,并且被训练为具有二值权重和二值特征图,这带来了显著的推理运行时间加速和内存使用减少。通过使用超过 200,000 张合成场景文本图像(大小为 32×12832\times128)进行训练,它在 ICDAR-03 和 ICDAR-13 数据集上分别可达到 90%90\%91%91\% 的像素级准确率。在 GPU 上实现的推理运行时间仅消耗 4.59 ms4.59\ ms,网络大小仅为 2.14 MB,比其全精度版本快 8×8\times 且小 96%96\%

关键词

引用

@article{arxiv.1612.03630,
  title  = {A Binary Convolutional Encoder-decoder Network for Real-time Natural Scene Text Processing},
  author = {Zichuan Liu and Yixing Li and Fengbo Ren and Hao Yu},
  journal= {arXiv preprint arXiv:1612.03630},
  year   = {2016}
}