中文

基于深度卷积线性金字塔的草体场景文本分析

计算机视觉与模式识别 2018-10-01 v1

摘要

相机捕获的图像具有多个可供研究的方面。通常,研究的重点取决于感兴趣的区域。有时焦点可能在于颜色分割、目标检测或场景文本分析。图像分析、可见性与版面分析对人类而言是较容易的任务(这符合人类的行为特征),但相反,当这些相同任务需由机器完成时,则显得颇具挑战。学习机器总是从所提供的样本的相关属性中学习。近年来已设计众多方法用于场景文本提取与识别,且为提高精度仍在持续努力。卷积方法在自然图像中出现的非草体文本分析上提供了合理的结果。本稿所呈现的工作通过将对每个金字塔视为所提供的样本的一个特征,利用了线性金字塔的优势。每个金字塔图像经由多个经验选定的核处理。通过考虑 EASTR-42k 数据集上每个图像金字塔的阿拉伯文本对其性能进行了研究。在阿拉伯场景文本识别上报告了 0.17% 的错误率。

关键词

引用

@article{arxiv.1809.10792,
  title  = {Cursive Scene Text Analysis by Deep Convolutional Linear Pyramids},
  author = {Saad Bin Ahmed and Saeeda Naz and Muhammad Imran Razzak and Rubiyah Yusof},
  journal= {arXiv preprint arXiv:1809.10792},
  year   = {2018}
}

备注

09 pages,6 figures, 25th International Conference on Neural Information Processing (ICONIP 2018)