中文

保加利亚历史文献的OCR后文本校正

计算与语言 2024-09-04 v1 数字图书馆 机器学习

摘要

历史文献的数字化对于保护社会文化遗产至关重要。此过程中的一个重要步骤是使用光学字符识别(OCR)将扫描图像转换为文本,这可以支持进一步的搜索、信息提取等。不幸的是,这是一个难题,因为标准的OCR工具并非为处理历史拼写法以及复杂的版面而定制。因此,在处理此类文档时,通常会对OCR输出应用额外的文本校正步骤。在这项工作中,我们聚焦于保加利亚语,并创建了第一个基准数据集,用于评估对以第一种标准化保加利亚语拼写法——19世纪的Drinov拼写法——书写的历史保加利亚文献的OCR文本校正。我们进一步开发了一种方法,通过利用大量当代保加利亚语文学文本,自动生成该拼写法以及随后的Ivanchev拼写法的合成数据。然后,我们使用最先进的大语言模型(LLM)和编码器-解码器框架,并通过对角线注意力损失以及复制和覆盖机制对其进行增强,以改进OCR后文本校正。所提出的方法减少了识别过程中引入的错误,并将文档质量提高了25%,与ICDAR 2019保加利亚语数据集上的最先进水平相比,提高了16%。我们在\url{https://github.com/angelbeshirov/post-ocr-text-correction}上发布了我们的数据和代码。

关键词

引用

@article{arxiv.2409.00527,
  title  = {Post-OCR Text Correction for Bulgarian Historical Documents},
  author = {Angel Beshirov and Milena Dobreva and Dimitar Dimitrov and Momchil Hardalov and Ivan Koychev and Preslav Nakov},
  journal= {arXiv preprint arXiv:2409.00527},
  year   = {2024}
}

备注

Accepted for publication in the International Journal on Digital Libraries