中文

使用文本增强与形状编码的场景图像与视频帧日期字段检索

计算机视觉与模式识别 2017-07-24 v1

摘要

由于分辨率低、模糊和背景噪声等原因,场景图像和视频帧中的文本识别十分困难。由于传统 OCR 在此类图像中表现不佳,使用关键词进行信息检索可能是索引/检索此类文本信息的替代方法。日期是一种有用的信息,具有多种应用,包括按日期的视频/场景搜索、索引或检索。本文提出了一种针对自然场景图像和视频帧的基于日期发现的信息检索系统,其中文本出现在复杂背景中。我们提出了一种使用隐马尔可夫模型 (HMM) 的基于行的日期发现方法,用于检测给定文本中的日期信息。在不分割字符或单词的情况下,从文本行中搜索不同的日期模型。给定 RGB 文本行图像,我们应用高效的灰度图像转换以增强文本信息。使用小波分解和梯度子带增强灰度文本信息。接下来,从灰度图像和二值图像中提取金字塔方向梯度直方图 (PHOG) 特征,用于日期发现框架。通过基于 MLP 的 Tandem 方法结合二值图像和灰度图像特征。最后,为了进一步提升性能,在词发现过程中使用基于形状编码的方案将形状相似的字符组合到同一类中。在实验中,我们构建了三种不同的日期模型,以搜索包含数字值和标点符号的数字日期,以及包含数字和月份的半数字日期的相似日期信息。我们在 1648 个文本行上测试了我们的系统,结果表明了我们提出的日期发现方法的有效性。

关键词

引用

@article{arxiv.1707.06833,
  title  = {Date-Field Retrieval in Scene Image and Video Frames using Text Enhancement and Shape Coding},
  author = {Partha Pratim Roy and Ayan Kumar Bhunia and Umapada Pal},
  journal= {arXiv preprint arXiv:1707.06833},
  year   = {2017}
}