中文

文本行在历史文档分类中的重要性

计算机视觉与模式识别 2022-03-31 v2

摘要

本文描述了布尔诺理工大学为 ICDAR 2021 历史文档分类竞赛所准备的系统的设计过程、相关实验及主要发现。所解决的任务包括文字系统与字体分类、文档来源定位以及断代。我们结合了块级与行级方法,其中行级系统利用了一个已有的、公开可用的页面布局分析引擎。在两个系统中,神经网络提供局部预测,并将其组合为页面级决策,且两个系统的结果通过线性或对数线性插值进行融合。我们提出了适用于弱监督分类问题(提供多个可能标签)的损失函数,以及适用于断代任务中间隔回归的损失函数。行级系统在文字系统与字体分类及断代任务中显著改善了结果。完整系统在字体、文字系统和位置分类任务中分别达到了 98.48%、88.84% 和 79.69% 的准确率。在断代任务中,我们的系统达到了 21.91 年的平均绝对误差。我们的系统在所有任务中均取得了最佳结果,并成为竞赛的总冠军。

关键词

引用

@article{arxiv.2201.09575,
  title  = {Importance of Textlines in Historical Document Classification},
  author = {Martin Kišš and Jan Kohút and Karel Beneš and Michal Hradiš},
  journal= {arXiv preprint arXiv:2201.09575},
  year   = {2022}
}

备注

13 pages, 7 figures, 5 tables