评估历史文档 OCR 中的大型语言模型:数字人文的方法论框架
计算机视觉与模式识别
2025-10-09 v1 人工智能
计算与语言
摘要
数字人文学者日益广泛地使用大型语言模型进行历史文档扫描识别,但缺乏适用于 LLM-based OCR 的评估框架。传统指标无法捕捉历史语料创建中至关重要的时序偏差和时期特定错误。我们present for LLM-based historical OCR 的评估方法论,解决 LLM-based OCR 中的污染风险和外交稿 transcription 中的系统性偏差问题。使用 18 世纪俄语民事字体文本,我们引入 novel 指标,包括历史字符保存率 (HCPR) 和古体插入率 (AIR),以及污染控制和稳定性测试的协议。我们评估了 12 个多模态 LLM,发现 Gemini 和 Qwen 模型在传统 OCR 之外表现更好,但 exhibit 过度历史化倾向:从错误的历史时期插入古体字符。后 OCR 纠正反而降低性能。我们的方法论为数字人文从业者提供了模型选择和历史语料扫描质量评估的指南。
引用
@article{arxiv.2510.06743,
title = {Evaluating LLMs for Historical Document OCR: A Methodological Framework for Digital Humanities},
author = {Maria Levchenko},
journal= {arXiv preprint arXiv:2510.06743},
year = {2025}
}
备注
The First Workshop on Natural Language Processing and Language Models for Digital Humanities (LM4DH 2025). RANLP 2025