处理重度缩写手稿:HTR 引擎与文本规范化方法之比较
计算与语言
2021-07-09 v1
摘要
尽管缩写在手写源中相当常见,尤其在中世纪和近代西方手稿中,但以往关于其计算展开的研究甚少。然而缩写对诸如手写文本识别与自然语言处理任务等计算方法提出了特殊挑战。通常,预处理的最终目标是从源的数字化图像得到规范化文本,其中包括缩写的展开。我们探索不同设置以获得此类规范化文本:要么直接通过在规范化(即展开、去缩写)文本上训练 HTR 引擎,要么将过程分解为离散步骤,各步骤利用专门的识别、词分割与规范化模型。此处考虑的个案研究取自中世纪拉丁传统。
引用
@article{arxiv.2107.03450,
title = {Handling Heavily Abbreviated Manuscripts: HTR engines vs text normalisation approaches},
author = {Jean-Baptiste Camps and Chahan Vidal-Gorène and Marguerite Vernet},
journal= {arXiv preprint arXiv:2107.03450},
year = {2021}
}
备注
Accompanying data available at: https://zenodo.org/record/5071964