丰富历史记录:一种用于数据库集成的OCR与AI驱动方法
计算与语言
2026-01-01 v1 人工智能
摘要
本研究对1983年至1985年间编写的《莱顿大学教授与讲师 1575-1815》(Leidse hoogleraren en lectoren 1575-1815)一书进行了数字化和分析,该书包含莱顿大学教授和馆长的传记数据。它探讨了一个核心问题:我们如何设计一个自动化流水线,整合OCR、基于LLM的解读和数据库链接,以将历史文档图像中的数据与现有高质量数据库记录进行协调?我们应用了OCR技术、构建数据提取结构的生成式AI解码约束以及数据库链接方法,将打字的历史记录处理为数字格式。OCR实现了1.08%的字符错误率(CER)和5.06%的词错误率(WER),而从OCR文本中提取JSON的平均准确率为63%,基于标注OCR的准确率为65%。这表明生成式AI在一定程度上纠正了较低的OCR性能。我们的记录链接算法以94%的准确率链接了标注的JSON文件,以81%的准确率链接了OCR衍生的JSON文件。本研究通过提供一个用于解读数字化历史文档的自动化流水线,解决了布局变异性和术语差异等挑战,并探索了先进生成式AI模型的适用性和优势,从而为数字人文学科研究做出了贡献。
引用
@article{arxiv.2512.23710,
title = {Enriching Historical Records: An OCR and AI-Driven Approach for Database Integration},
author = {Zahra Abedi and Richard M. K. van Dijk and Gijs Wijnholds and Tessa Verhoef},
journal= {arXiv preprint arXiv:2512.23710},
year = {2026}
}