中文

CLOCR-C:利用预训练语言模型的上下文 OCR 纠正

计算与语言 2025-01-23 v2 数字图书馆

摘要

历史印刷媒体档案的数字化对于提高当代记录的可访问性至关重要。然而,用于将物理记录转换为数字文本的光学字符识别(OCR)过程容易出现错误,特别是对于报纸和期刊,因为它们的布局复杂。本文介绍了上下文利用 OCR 纠正(CLOCR-C),它利用基于 Transformer 的语言模型的填充和上下文自适应能力来提高 OCR 质量。本研究旨在确定 LM 能否执行 OCR 后纠正、改善下游 NLP 任务,以及将社会文化背景作为纠正过程一部分提供的价值。实验在三个数据集上使用了七个 LM 进行:19 世纪连续出版物版(NCSE)和两个来自 Overproof 集合的数据集。结果表明,一些 LM 可以显著降低错误率,表现最好的模型在 NCSE 数据集上的字符错误率降低了 60% 以上。OCR 的改进扩展到下游任务,如命名实体识别,余弦命名实体相似度增加。此外,研究表明,在提示中提供社会文化背景可提高性能,而误导性提示会降低性能。除了这些发现外,本研究还发布了来自 NCSE 的 91 篇转录文章的数据集,包含总计 4 万词,以支持该领域的进一步研究。研究结果表明,CLOCR-C 是一种有前途的方法,通过利用嵌入在 LM 和需要纠正的文本中的社会文化信息来提高现有数字档案的质量。

关键词

引用

@article{arxiv.2408.17428,
  title  = {CLOCR-C: Context Leveraging OCR Correction with Pre-trained Language Models},
  author = {Jonathan Bourne},
  journal= {arXiv preprint arXiv:2408.17428},
  year   = {2025}
}

备注

20 pages, 2 figures,