中文

基于分区的孟加拉文与天城文文档关键词 spotting

计算机视觉与模式识别 2017-12-06 v1

摘要

本文提出了一种针对孟加拉文(Bengali)和天城文等离线印度文字文本行的关键词 spotting 系统。最近研究表明,在印度文字中,分区识别方法比传统的整词识别系统具有更好的词识别性能。受此启发,我们采用分区分割方法,并利用中间区信息来改进传统的关键词 spotting 性能。为避免使用启发式方法进行分区分割的问题,我们提出了一种基于 HMM 的方法,从文本行图像中分割出上区和下区部件。候选关键词在无需分割字符或单词的情况下从文本行中搜索。此外,我们提出了一种结合文本行图像前景与背景信息的新特征,用于基于字符填充模型的关键词 spotting。实验表明,同时使用前景和背景信息比单独使用其中之一在性能上有显著提升。我们的关键词 spotting 框架中使用了方向梯度金字塔直方图(PHOG)特征。实验表明,所提出的基于分区分割的系统优于传统的关键词 spotting 方法。

关键词

引用

@article{arxiv.1712.01434,
  title  = {Zone-based Keyword Spotting in Bangla and Devanagari Documents},
  author = {Ayan Kumar Bhunia and Partha Pratim Roy and Umapada Pal},
  journal= {arXiv preprint arXiv:1712.01434},
  year   = {2017}
}

备注

Preprint Submitted