中文

ViBERTgrid:一种用于文档关键信息抽取的多模态二维文档联合训练表示

计算与语言 2021-05-26 v1 计算机视觉与模式识别 机器学习

摘要

近期基于网格的文档表示方法如 BERTgrid 能够将文档的文本和版式信息同时编码到二维特征图中,从而可直接利用最先进的图像分割和/或目标检测模型从文档中抽取关键信息。然而,此类方法的性能尚不及最先进的基于序列和图的方法(如 LayoutLM 和 PICK)。本文中,我们提出一种新的多模态骨干网络,将 BERTgrid 拼接至 CNN 模型的中间层(CNN 的输入为文档图像,BERTgrid 为词嵌入的网格),以生成更强大的基于网格的文档表示,命名为 ViBERTgrid。与 BERTgrid 不同,我们的多模态骨干网络中 BERT 和 CNN 的参数是联合训练的。实验结果表明,该联合训练策略显著提升了 ViBERTgrid 的表示能力。因此,我们基于 ViBERTgrid 的关键信息抽取方法在真实世界数据集上取得了最先进的性能。

关键词

引用

@article{arxiv.2105.11672,
  title  = {ViBERTgrid: A Jointly Trained Multi-Modal 2D Document Representation for Key Information Extraction from Documents},
  author = {Weihong Lin and Qifang Gao and Lei Sun and Zhuoyao Zhong and Kai Hu and Qin Ren and Qiang Huo},
  journal= {arXiv preprint arXiv:2105.11672},
  year   = {2021}
}

备注

To be published at ICDAR 2021