中文

解锁档案:使用大语言模型转录手写历史文献

计算机视觉与模式识别 2024-11-07 v1 计算与语言 数字图书馆 机器学习

摘要

本研究表明,大语言模型(LLMs)转录历史手写文献的准确率显著高于专用的手写文本识别(HTR)软件,同时速度更快且更具成本效益。我们引入了一款名为 Transcription Pearl 的开源软件工具,该工具利用 OpenAI、Anthropic 和 Google 的商用多模态 LLMs 自动转录和校正批次手写文献。在包含 18/19 世纪英语手写文献的多样化语料库测试中,LLMs 的字符错误率(CER)为 5.7% 至 7%,词错误率(WER)为 8.9% 至 15.9%,相比 Transkribus 等最先进的专用 HTR 软件分别提高了 14% 和 32%。最显著的是,当使用 LLMs 校正这些转录文本以及常规 HTR 软件生成的文本时,它们达到了接近人类的准确率,即 CER 低至 1.8%,WER 为 3.5%。LLMs 完成这些任务的速度也快了 50 倍,成本约为专有 HTR 程序的 1/50。这些结果表明,当 LLMs 被整合到 Transcription Pearl 等软件工具中时,它们为历史手写文献的大规模转录提供了一种易于访问、快速且高度准确的方法,显著简化了数字化过程。

关键词

引用

@article{arxiv.2411.03340,
  title  = {Unlocking the Archives: Using Large Language Models to Transcribe Handwritten Historical Documents},
  author = {Mark Humphries and Lianne C. Leddy and Quinn Downton and Meredith Legace and John McConnell and Isabella Murray and Elizabeth Spence},
  journal= {arXiv preprint arXiv:2411.03340},
  year   = {2024}
}

备注

29 Pages, 11 Tables, 2 Figures