中文

用于富视觉文档多模态信息抽取的图卷积方法

信息检索 2019-03-28 v1 计算机视觉与模式识别 机器学习

摘要

富视觉文档(VRDs)在日常业务与生活中无处不在,例如采购收据、保险单文档、报关单等。在富视觉文档中,视觉与版式信息对文档理解至关重要,此类文档中的文本若序列化为一维序列则会丢失信息。经典的如 BiLSTM-CRF 等信息抽取模型通常作用于文本序列,并不融合视觉特征。本文提出一种基于图卷积的模型,以结合富视觉文档中呈现的文本与视觉信息。通过训练图嵌入来概括文档中文本段的上下文,并进一步与文本嵌入结合用于实体抽取。我们在两个真实世界数据集上进行了大量实验,表明我们的方法以显著优势优于 BiLSTM-CRF 基线。此外,我们还进行了消融实验以评估模型各组件的有效性。

关键词

引用

@article{arxiv.1903.11279,
  title  = {Graph Convolution for Multimodal Information Extraction from Visually Rich Documents},
  author = {Xiaojing Liu and Feiyu Gao and Qiong Zhang and Huasha Zhao},
  journal= {arXiv preprint arXiv:1903.11279},
  year   = {2019}
}

备注

naacl'19 accepted paper