半结构化历史手写记录中信息抽取的基准测试
计算机视觉与模式识别
2018-07-18 v1 计算与语言
摘要
在本报告中,我们展示了在IEHHR - ICDAR 2017鲁棒阅读竞赛的Esposalles历史手写婚姻记录上进行信息抽取基准测试实验的发现。信息抽取被建模为跨2组标签的序列语义标注。这可以通过顺序或联合应用手写文本识别(HTR)和命名实体识别(NER)来实现。我们部署了一种流水线方法,首先使用最先进的HTR并将其输出作为NER的输入。我们表明,在资源匮乏的设置和记录结构简单的情况下,HTR的高性能确保了整体高性能。我们探索了条件随机场和神经网络的各种配置,以在给定的某些噪声输入上对标NER进行基准测试。在10折交叉验证以及盲测数据上最佳的模型使用了带有双向长短期记忆的n-gram特征。
引用
@article{arxiv.1807.06270,
title = {Bench-Marking Information Extraction in Semi-Structured Historical Handwritten Records},
author = {Animesh Prasad and Hervé Déjean and Jean-Luc Meunier and Max Weidemann and Johannes Michael and Gundram Leifert},
journal= {arXiv preprint arXiv:1807.06270},
year = {2018}
}