中文

未转录手写文档的开放集分类

计算机视觉与模式识别 2022-06-28 v1 计算与语言 信息检索 机器学习

摘要

全球档案机构中保存着大量重要手稿的数字页面图像。其数量之巨,以至于档案管理员通常无法为大多数文档妥善标注所需元数据,从而导致档案的低效组织以及学者与公众的检索困难。文档的类别或“类型”或许是元数据中最重要的标签。技术问题在于:如何根据图像中的文本内容,对由一组未转录手写文本图像构成的文档进行自动分类。所考虑的方法基于“概率索引”——一项相对新颖的技术,可有效表示手写文本图像所固有的词级不确定性。我们在一个来自西班牙 Archivo Histórico Provincial de Cádiz 的大型复杂公证手稿集合上评估了该方法的性能,取得了有前景的结果。

关键词

引用

@article{arxiv.2206.13342,
  title  = {Open Set Classification of Untranscribed Handwritten Documents},
  author = {José Ramón Prieto and Juan José Flores and Enrique Vidal and Alejandro H. Toselli and David Garrido and Carlos Alonso},
  journal= {arXiv preprint arXiv:2206.13342},
  year   = {2022}
}