中文

基于 Transformer 的文本转录分析中的空白处

计算机视觉与模式识别 2024-07-02 v1 计算与语言

摘要

历史文件常常因损坏和不一致性而受到影响,包括因孔洞、墨水问题或储存损坏等问题导致的文本缺失或不可辨认。这些缺失的部分或空白处被称为 lacunae。本研究中,我们采用在包含 lacunae 的合成数据上进行监督式训练的基于 Transformer 的光学字符识别 (OCR) 模型。我们展示了其在检测和恢复 lacunae 方面的有效性,恢复成功率达到 65%,而基准模型缺乏对 lacunae 的认识,仅实现 5% 的恢复。此外,我们还考察了模型的机制特性,如转录的对数概率,可在不直接检查图像的情况下识别 lacunae 和其他错误(例如因复杂书写或墨水问题导致的误转录)。这种能力对寻求区分含有 lacunae 或错误的图像与干净图像的学者而言可能具有重要价值。尽管我们探索了注意力机制在标记 lacunae 和转录错误方面的潜力,但我们的发现表明这并不是一个显著因素。我们的工作凸显了利用基于 Transformer 的 OCR 模型恢复或分析受损历史文件方面的前景方向。

关键词

引用

@article{arxiv.2407.00250,
  title  = {Mind the Gap: Analyzing Lacunae with Transformer-Based Transcription},
  author = {Jaydeep Borkar and David A. Smith},
  journal= {arXiv preprint arXiv:2407.00250},
  year   = {2024}
}

备注

Accepted to ICDAR 2024 Workshop on Computational Paleography