中文

VisualWordGrid:基于多模态方法的扫描文档信息抽取

计算机视觉与模式识别 2021-07-06 v5 机器学习

摘要

我们提出了一种用于扫描文档表示以执行字段抽取的新方法。该方法能够将文本、视觉和布局信息同时编码为一个三轴张量,并作为分割模型的输入。我们在多个方面改进了近期的 Chargrid 和 Wordgrid \cite{chargrid} 模型:首先引入视觉模态,其次在保持较低推理时间的同时提升其对小数据集的鲁棒性。我们的方法在公开和私有的文档图像数据集上进行了测试,相比近期最先进的方法表现出更优的性能。

关键词

引用

@article{arxiv.2010.02358,
  title  = {VisualWordGrid: Information Extraction From Scanned Documents Using A Multimodal Approach},
  author = {Mohamed Kerroumi and Othmane Sayem and Aymen Shabou},
  journal= {arXiv preprint arXiv:2010.02358},
  year   = {2021}
}