中文

GraphRevisedIE:基于图修订网络的多模态信息抽取

信息检索 2024-10-03 v1 计算机视觉与模式识别

摘要

从视觉丰富文档(VRD)中抽取关键信息(Key Information Extraction, KIE)是文档智能中的一个具有挑战性的任务,原因在于VRD的布局复杂多变,使得模型难以泛化,同时缺乏有效利用其多模态特征的方法。本文提出一种轻量级模型GraphRevisedIE,通过图修订与图卷积机制,有效地嵌入来自VRD的文本、视觉及布局特征,并利用图结构丰富多模态嵌入以捕获全局上下文。在多个真实世界数据集上进行的大量实验表明,GraphRevisedIE能够对布局各异的文档实现良好泛化,性能与以往的KIE方法相当或更优。我们还发布了一个包含真实文档与合成文档的商务执照数据集,以促进文档KIE研究的开展。

关键词

引用

@article{arxiv.2410.01160,
  title  = {GraphRevisedIE: Multimodal Information Extraction with Graph-Revised Network},
  author = {Panfeng Cao and Jian Wu},
  journal= {arXiv preprint arXiv:2410.01160},
  year   = {2024}
}