面向自动转录中世纪手稿的旧法语与拉丁文的前编辑归一化
计算与语言
2026-02-17 v1
摘要
近期的自动文本识别(ATR)技术的进展提升了对历史档案的访问能力,但人类学手稿校勘与数字化版本之间仍存在方法论鸿沟。尽管在更符合人类学特征的数据集(如 CATMuS)上训练的 ATR 模型表现出更好的可迁移性,但其原始输出仍不易被大多数读者和下游 NLP 工具理解,从而造成可用性差距。另一方面,训练生成归一化输出的 ATR 模型则在适应新领域时表现不佳,容易过度归一化并产生幻觉。我们提出了前编辑归一化(Pre-Editorial Normalization,PEN)任务,即依据编辑规范对 graphemic ATR 输出进行归一化处理,该方法的优势在于保留人类学保真度的中间步骤,同时提供可实用性的归一化版本。我们 presenting 一个新的数据集,源自 CoMMA 语料库,并通过 passim 对齐了已数字化的旧法语和拉丁文版本。我们还产生了一个手动校正的金标准评估集。我们采用 ByT5 基的序列到序列模型对归一化和预标注任务进行基准测试。我们的贡献包括:PEN 的正式定义、4.66 百万样本的银标准训练语料、1800 样本的金标准评估集,以及实现 6.7% CER 的归一化模型,在该任务中显著优于先前模型。
引用
@article{arxiv.2602.13905,
title = {Pre-Editorial Normalization for Automatically Transcribed Medieval Manuscripts in Old French and Latin},
author = {Thibault Clérice and Rachel Bawden and Anthony Glaise and Ariane Pinche and David Smith},
journal= {arXiv preprint arXiv:2602.13905},
year = {2026}
}