中文

19 世纪古典注释的光学字符识别:现状

数字图书馆 2021-10-14 v1 计算机视觉与模式识别

摘要

与校勘本和译本一起,注释是文学与文本学术中的主要出版类型之一,并拥有长达数个世纪的传统。然而,数千部数字化的历史注释的利用迄今受到光学字符识别(OCR)质量低下的阻碍,尤其是对希腊文注释而言。在本文中,我们评估了两条适用于历史古典注释 OCR 的流水线性能。我们的结果表明,在含有高密度多调希腊文文本的注释部分,Kraken + Ciaconna 达到的字符错误率(CER)显著低于 Tesseract/OCR-D(平均 CER 7% 对 13%),而在主要以拉丁文字书写的文本部分,Tesseract/OCR-D 比 Kraken + Ciaconna 略为准确(平均 CER 8.2% 对 8.4%)。作为本文的一部分,我们还发布了 GT4HistComment(一个带有 19 部古典注释 OCR 真值的小数据集)和 Pogretra(一个包含多种古希腊字体训练数据与预训练模型的大型集合)。

关键词

引用

@article{arxiv.2110.06817,
  title  = {Optical Character Recognition of 19th Century Classical Commentaries: the Current State of Affairs},
  author = {Matteo Romanello and Sven Najem-Meyer and Bruce Robertson},
  journal= {arXiv preprint arXiv:2110.06817},
  year   = {2021}
}