中文

Devanagari、Telugu 与 Malayalam 场景文本识别基准评测

计算机视觉与模式识别 2021-04-12 v1

摘要

受基于深度学习的英文场景文本识别方法成功的启发,我们提出并基准评测了三种印度文字——Devanagari、Telugu 与 Malayalam 的场景文本识别。使用 Unicode 字体渲染的合成词图像训练识别系统。性能在一个新的 IIIT-ILST 数据集上进行了基准评测,该数据集包含数百张含上述文字的真实场景图像。我们采用一种免分割、混合但端到端可训练的 CNN-RNN 深度神经网络,将词图像转写为相应文本。裁剪后的词图像无需分割为子词单元,误差针对给定词图像一次性计算并反向传播。网络使用 CTC 损失训练,该损失已被证明对序列到序列转写任务十分有效。网络中的 CNN 层学习从词图像中提取鲁棒特征表示。卷积块学到的特征序列由 RNN+CTC 块转写为标签序列。该转写不受词长或词典限制,非常适于高度屈折的印度语言。IIIT-ILST 数据集、合成词图像数据集以及用于渲染合成图像的脚本可在 http://cvit.iiit.ac.in/research/projects/cvit-projects/iiit-ilst 获取。

关键词

引用

@article{arxiv.2104.04437,
  title  = {Benchmarking Scene Text Recognition in Devanagari, Telugu and Malayalam},
  author = {Minesh Mathew and Mohit Jain and CV Jawahar},
  journal= {arXiv preprint arXiv:2104.04437},
  year   = {2021}
}

备注

This work was accepted at MOCR Workshop, ICDAR 2017 Uploading updated draft which includes links to download datasets and rendering script