中文

民主化中世纪英语法律传统

计算机视觉与模式识别 2026-05-05 v1 人工智能 计算与语言

摘要

最广为人知的法律体系的起源记录包含数百万页手稿。而众多英语法律体系的最初几个世纪的记录,大多手写于高度缩略形式的中世纪拉丁文,其中仅有少数几 dozen 名学者具备阅读能力。本跨学科项目中,我们构建了一个包含 4029 行文本、覆盖 193 起中世纪刑事和民事案件的数据集。随后我们利用该数据集训练一个开源的端到端管道,用于转录这些手稿。我们首先训练标准神经网络架构进行行分割和手写识别(分别采用 R-Blla 和 CNN+LSTM 配合 CTC 解码),并表明即便在训练集相对较小且扩写缩略词具有挑战性的情况下,仍可实现 79% 的词准确率。随后我们演示,简单的后处理显著提升了准确率:将 n-gram 语言模型加入 CTC 解码器可将词准确率提升至 82%,而让 Gemini Pro 3 纠正错误可将准确率提升至 88%。最后,我们比较了 CNN+LSTM 架构与 TrOCR——一种基于 Transformer 的 OCR 架构,证明 TrOCR 在词准确率上相当,但在字准确率上较差,由于其过于愿意猜测,使得人类难以推断正确的阅读。我们将所构建的管道整合到网页门户(glyphmachina.com),为法律学家、中世纪学家和学生开放了英语法律传统。

关键词

引用

@article{arxiv.2605.00977,
  title  = {Democratizing the medieval English legal tradition},
  author = {Michael Zhang and Elise Wang and Charlotte Whatley and Seth Strickland and Dylan Bannon},
  journal= {arXiv preprint arXiv:2605.00977},
  year   = {2026}
}

备注

Submitted to International Conference on Document Analysis and Recognition (ICDAR) 2026