VisualWordGrid:基于多模态方法的扫描文档信息抽取
计算机视觉与模式识别
2021-07-06 v5 机器学习
摘要
我们提出了一种用于扫描文档表示以执行字段抽取的新方法。该方法能够将文本、视觉和布局信息同时编码为一个三轴张量,并作为分割模型的输入。我们在多个方面改进了近期的 Chargrid 和 Wordgrid \cite{chargrid} 模型:首先引入视觉模态,其次在保持较低推理时间的同时提升其对小数据集的鲁棒性。我们的方法在公开和私有的文档图像数据集上进行了测试,相比近期最先进的方法表现出更优的性能。
引用
@article{arxiv.2010.02358,
title = {VisualWordGrid: Information Extraction From Scanned Documents Using A Multimodal Approach},
author = {Mohamed Kerroumi and Othmane Sayem and Aymen Shabou},
journal= {arXiv preprint arXiv:2010.02358},
year = {2021}
}