中文

用于漫画文本检测与识别的综合金标准与基准

计算与语言 2023-01-02 v1 人工智能

摘要

本研究致力于改进 COMICS 数据集中漫画面板的 optical character recognition(OCR,光学字符识别)数据,该数据集是包含漫画书文本与图像的最大数据集。为此,我们开发了一条用于漫画书 OCR 处理与标注的流程,并创建了首个面向西方漫画的文本检测与识别数据集,称为“COMICS Text+: Detection”与“COMICS Text+: Recognition”。我们在这些数据集上评估了最先进的文本检测与识别模型的性能,发现相较于 COMICS 中的文本,词准确率与归一化编辑距离均有显著改善。我们还创建了一个名为“COMICS Text+”的新数据集,其中包含从 COMICS 数据集文本框中提取的文本。在的漫画处理模型中使用 COMICS Text+ 的改进文本数据,在不改变模型架构的情况下实现了 cloze-style(完形填空式)任务的最先进性能。COMICS Text+ 数据集可成为从事文本检测、识别及漫画高层处理(如叙事理解、角色关系和故事生成)等任务研究人员的宝贵资源。所有数据与推理说明可在 https://github.com/gsoykan/comics_text_plus 获取。

关键词

引用

@article{arxiv.2212.14674,
  title  = {A Comprehensive Gold Standard and Benchmark for Comics Text Detection and Recognition},
  author = {Gürkan Soykan and Deniz Yuret and Tevfik Metin Sezgin},
  journal= {arXiv preprint arXiv:2212.14674},
  year   = {2023}
}

备注

33 pages, 10 figures, 16 tables