中文

面向OCR后纠错的众包策略优化

人机交互 2023-08-01 v2

摘要

历史文献的数字化是许多数字人文项目中的一项挑战性任务。一种流行的数字化方法是先将文献扫描为图像,随后使用光学字符识别(OCR)算法将图像转为文本。然而,历史文献OCR处理的结果通常不准确,需要后处理纠错。本研究探讨如何利用众包修正历史文本集合中的OCR错误,以及在不同场景与各类研究目标下哪种众包方法最为有效。我们在亚马逊Mechanical Turk平台上组织753名工作者参与不同微任务结构与文本长度的一系列实验。工作者须修正所选历史文本中的OCR错误。为分析结果,设计了新的准确率与效率度量。分析表明,就准确率而言,最优文本长度为中等(段落级),最优实验结构为带扫描图像的两阶段;就效率而言,采用无图像单阶段较长文本时结果最佳。本研究为研究者如何构建最优OCR后纠错众包任务提供实用建议。所开发方法亦可用于创建自动OCR后纠错的黄金标准历史文本。这是首次系统探究各类因素对基于众包的OCR后纠错的影响并提出该过程的最优策略。

关键词

引用

@article{arxiv.2106.06831,
  title  = {Toward the Optimized Crowdsourcing Strategy for OCR Post-Correction},
  author = {Omri Suissa and Avshalom Elmalech and Maayan Zhitomirsky-Geffet},
  journal= {arXiv preprint arXiv:2106.06831},
  year   = {2023}
}

备注

25 pages, 12 figures, 1 table