中文

图像中振假名文本的 detection

计算机视觉与模式识别 2022-07-11 v1

摘要

振假名(furigana)是日本书写中使用的发音标注。能够检测这些标注有助于提升光学字符识别(OCR)性能,或通过正确显示振假名制作更精确的日文书面媒体数字副本。本项目聚焦于检测日本书籍与漫画中的振假名。尽管已有关于日文文本检测的研究,但目前尚无针对振假名检测的方法。我们构建了一个包含日文书面媒体及振假名标注的新数据集。我们提出了一种针对此类数据的评估指标,其类似于目标检测中使用的评估协议,但允许一组对象由一个标注标记。我们提出了一种基于数学形态学与连通域分析的振假名检测方法。我们对该数据集上的检测结果进行了评估,并比较了不同的文本提取方法。我们还分别评估了书籍与漫画等不同类型的图像,并讨论了各类图像的挑战。所提方法在数据集上达到了 76% 的 F1-score。该方法在普通书籍上表现良好,但在漫画及非规则版式书籍上表现较差。最后,我们表明所提方法在 manga109 数据集上可将 OCR 性能提升 5%。源代码可通过 \texttt{\url{https://github.com/nikolajkb/FuriganaDetection}} 获取。

关键词

引用

@article{arxiv.2207.03960,
  title  = {Detection of Furigana Text in Images},
  author = {Nikolaj Kjøller Bjerregaard and Veronika Cheplygina and Stefan Heinrich},
  journal= {arXiv preprint arXiv:2207.03960},
  year   = {2022}
}

备注

This project was originally submitted by NKB in fulfillment of the 30 ECTS MSc thesis at the IT University of Copenhagen