中文

GMN:面向实用文档信息抽取的生成式多模态网络

计算与语言 2022-07-12 v1

摘要

文档信息抽取(DIE)因其在现实世界中的各种高级应用而受到越来越多的关注。尽管近期文献已取得具有竞争力的结果,这些方法在处理带有噪声OCR结果或易变版式的复杂文档时通常表现不佳。本文提出用于真实场景的生成式多模态网络(GMN)以解决这些问题,它是一种无需预定义标签类别的鲁棒多模态生成方法。借助精心设计的空间编码器和模态感知掩码模块,GMN能够处理难以序列化为顺序结构的复杂文档。此外,GMN可容忍OCR结果中的错误且无需字符级标注,这一点至关重要,因为大量文档的细粒度标注费时费力,甚至需要具有专业领域知识的标注人员。大量实验表明,GMN在多个公开DIE数据集上取得了新的SOTA性能,并以较大优势超越其他方法,尤其在真实场景中。

关键词

引用

@article{arxiv.2207.04713,
  title  = {GMN: Generative Multi-modal Network for Practical Document Information Extraction},
  author = {Haoyu Cao and Jiefeng Ma and Antai Guo and Yiqing Hu and Hao Liu and Deqiang Jiang and Yinsong Liu and Bo Ren},
  journal= {arXiv preprint arXiv:2207.04713},
  year   = {2022}
}

备注

Accepted to NAACL 2022 main conference