用于漫画文本检测与识别的综合金标准与基准
计算与语言
2023-01-02 v1 人工智能
摘要
本研究致力于改进 COMICS 数据集中漫画面板的 optical character recognition(OCR,光学字符识别)数据,该数据集是包含漫画书文本与图像的最大数据集。为此,我们开发了一条用于漫画书 OCR 处理与标注的流程,并创建了首个面向西方漫画的文本检测与识别数据集,称为“COMICS Text+: Detection”与“COMICS Text+: Recognition”。我们在这些数据集上评估了最先进的文本检测与识别模型的性能,发现相较于 COMICS 中的文本,词准确率与归一化编辑距离均有显著改善。我们还创建了一个名为“COMICS Text+”的新数据集,其中包含从 COMICS 数据集文本框中提取的文本。在的漫画处理模型中使用 COMICS Text+ 的改进文本数据,在不改变模型架构的情况下实现了 cloze-style(完形填空式)任务的最先进性能。COMICS Text+ 数据集可成为从事文本检测、识别及漫画高层处理(如叙事理解、角色关系和故事生成)等任务研究人员的宝贵资源。所有数据与推理说明可在 https://github.com/gsoykan/comics_text_plus 获取。
引用
@article{arxiv.2212.14674,
title = {A Comprehensive Gold Standard and Benchmark for Comics Text Detection and Recognition},
author = {Gürkan Soykan and Deniz Yuret and Tevfik Metin Sezgin},
journal= {arXiv preprint arXiv:2212.14674},
year = {2023}
}
备注
33 pages, 10 figures, 16 tables