使用动态形状编码在多文字场景图像和视频帧中进行单词搜索
计算机视觉与模式识别
2018-07-31 v6 信息检索
摘要
从自然场景图像和视频帧中检索文本信息是一项具有挑战性的任务,因为它存在诸如复杂字符形状、低分辨率、背景噪声等固有问题。现有的 OCR 系统通常无法在此类场景/视频帧中检索到信息。关键词识别(keyword spotting)作为一种替代的信息检索方式,在此类场景中执行高效的文本搜索。然而,当前场景/视频图像中的单词识别技术是特定于文字的,并且主要针对拉丁文字开发。本文提出了一种新颖的单词识别框架,该框架使用动态形状编码在自然场景图像和视频帧中进行文本检索。该框架旨在借助针对相应文字的即时文字关键词生成,从多种文字中搜索查询关键词。我们采用了一种基于隐马尔可夫模型(HMM)的两阶段单词识别方法,通过识别文本行的文字来检测给定文本行中翻译后的关键词。一种新颖的基于无监督动态形状编码的方案被用于对相似形状字符进行分组,以避免混淆并改善文本对齐。接下来,对假设位置进行验证以提高检索性能。为评估所提出的系统在自然场景图像和视频帧中搜索关键词的性能,我们考虑了两种流行的印度文字,如孟加拉文(Bengali)和天城文(Devanagari),以及英文。受印度文字中分区识别方法[1]的启发,分区文本信息被用于提高传统单词识别在印度文字中的性能。在我们的实验中,使用了一个包含英文、孟加拉文和天城文的不同场景图像和视频帧的数据集。获得的结果显示了我们提出的单词识别方法的有效性。
引用
@article{arxiv.1708.05529,
title = {Word Searching in Scene Image and Video Frame in Multi-Script Scenario using Dynamic Shape Coding},
author = {Partha Pratim Roy and Ayan Kumar Bhunia and Avirup Bhattacharyya and Umapada Pal},
journal= {arXiv preprint arXiv:1708.05529},
year = {2018}
}
备注
Multimedia Tools and Applications, Springer