中文

清理脏书:面向已扫描文本的 OCR 后处理

计算与语言 2021-10-25 v1

摘要

为使大型数字化书籍集可用于 NLP 分析,需要大量工作进行清理,这既因为扫描文本中存在错误,也因为语料库中存在重复卷册。本文考虑在存在光学字符识别(OCR)错误情况下的去重问题。我们提出处理这些错误的方法,并在来自 Project Gutenberg 数据集的 19,347 篇文本和来自 HathiTrust Library 的 96,635 篇文本的集合上进行了评估。我们证明,语言模型的改进如今使得能够在无需考虑扫描图像本身的情况下检测并纠正 OCR 错误。通过对同一底层作品的扫描对进行比对所发现的不一致,为构建检测和纠正错误的模型提供了训练数据。我们从 58,808 次扫描中识别出 17,136 本重复扫描书籍的规范版本。最后,我们研究了检测和纠正单副本文本中错误的方法。我们表明,平均而言,我们的方法纠正的错误是其引入错误的六倍以上。我们还提供了关于扫描质量与地点、出版年份等其他因素之间关系的有趣分析。

关键词

引用

@article{arxiv.2110.11934,
  title  = {Cleaning Dirty Books: Post-OCR Processing for Previously Scanned Texts},
  author = {Allen Kim and Charuta Pethe and Naoya Inoue and Steve Skiena},
  journal= {arXiv preprint arXiv:2110.11934},
  year   = {2021}
}

备注

Accepted for Findings of EMNLP 2021