深度无模板表单视觉解析
计算机视觉与模式识别
2019-09-20 v2
摘要
由于表单版式多样,从表单图像中自动、无模板地提取信息具有挑战性。对于历史表单而言,由于噪声和退化,这一任务更具挑战性。提取过程的关键环节是将输入文本与预印标签相关联。我们提出了一种基于学习的无模板方案,用于检测预印文本与输入文本/手写内容,并预测它们之间的成对关系。此前针对该问题的方法集中于清晰图像和明确版式,而我们表明该方法在噪声大、退化且多变的表单图像领域同样有效。我们引入了一个历史表单图像数据集(19世纪末、20世纪初)用于训练和验证我们的方法。我们的方法使用卷积网络检测预印文本行和输入文本行,并从检测网络中池化特征,以与语言无关的方式对可能的关系进行分类。我们展示了所提出的配对方法优于启发式规则,且视觉特征对获得高精度至关重要。
引用
@article{arxiv.1909.02576,
title = {Deep Visual Template-Free Form Parsing},
author = {Brian Davis and Bryan Morse and Scott Cohen and Brian Price and Chris Tensmeyer},
journal= {arXiv preprint arXiv:1909.02576},
year = {2019}
}
备注
Accepted at ICDAR 2019. Updated results with average of repeated experiments