中文

将实体建模为语义点以进行真实场景下的视觉信息抽取

计算机视觉与模式识别 2023-03-30 v2

摘要

近年来,由于广泛的实际应用,视觉信息抽取(VIE)在学术界和工业界正变得日益重要。此前,已有大量工作被提出以解决该问题。然而,用于评估这些方法的基准相对简单,即这些基准未能充分代表具有真实世界复杂性的场景。作为本工作的第一项贡献,我们策划并发布了一个用于VIE的新数据集,其中文档图像更具挑战性,因为它们来自真实应用,并且模糊、部分遮挡和打印偏移等困难十分常见。所有这些因数可能导致信息抽取失败。因此,作为第二项贡献,我们探索了一种替代方法,以在此类严苛条件下从文档图像中精确且鲁棒地抽取关键信息。具体而言,与以往通常将视觉信息融入多模态架构或以端到端方式训练文本 spotting 与信息抽取的方法不同,我们显式地将实体建模为语义点,即实体的中心点被赋予描述不同实体属性与关系的语义信息,这可极大有益于实体标注与链接。在该领域标准基准及所提出数据集上的大量实验表明,与先前最先进的模型相比,所提方法在实体标注与链接上取得了显著提升。数据集可在 https://www.modelscope.cn/datasets/damo/SIBR/summary 获取。

关键词

引用

@article{arxiv.2303.13095,
  title  = {Modeling Entities as Semantic Points for Visual Information Extraction in the Wild},
  author = {Zhibo Yang and Rujiao Long and Pengfei Wang and Sibo Song and Humen Zhong and Wenqing Cheng and Xiang Bai and Cong Yao},
  journal= {arXiv preprint arXiv:2303.13095},
  year   = {2023}
}