未转录手写文档的开放集分类
计算机视觉与模式识别
2022-06-28 v1 计算与语言
信息检索
机器学习
摘要
全球档案机构中保存着大量重要手稿的数字页面图像。其数量之巨,以至于档案管理员通常无法为大多数文档妥善标注所需元数据,从而导致档案的低效组织以及学者与公众的检索困难。文档的类别或“类型”或许是元数据中最重要的标签。技术问题在于:如何根据图像中的文本内容,对由一组未转录手写文本图像构成的文档进行自动分类。所考虑的方法基于“概率索引”——一项相对新颖的技术,可有效表示手写文本图像所固有的词级不确定性。我们在一个来自西班牙 Archivo Histórico Provincial de Cádiz 的大型复杂公证手稿集合上评估了该方法的性能,取得了有前景的结果。
引用
@article{arxiv.2206.13342,
title = {Open Set Classification of Untranscribed Handwritten Documents},
author = {José Ramón Prieto and Juan José Flores and Enrique Vidal and Alejandro H. Toselli and David Garrido and Carlos Alonso},
journal= {arXiv preprint arXiv:2206.13342},
year = {2022}
}