面向关键信息抽取的空间双模态图推理
计算机视觉与模式识别
2021-03-29 v1
摘要
从文档图像中抽取关键信息在办公自动化中至关重要。传统的基于模板匹配的方法难以很好地泛化到未见模板的文档图像,并且对文本识别错误不够鲁棒。本文中,我们提出一种端到端的空间双模态图推理方法(SDMG-R)以从非结构化文档图像中抽取关键信息。我们将文档图像建模为双模态图,其节点编码检测到的文本区域的视觉与文本特征,其边表示相邻文本区域之间的空间关系。关键信息抽取通过沿图边迭代传播消息并推理图节点的类别来解决。为了全面评估我们所提出的方法并推动未来研究,我们发布了一个名为 WildReceipt 的新数据集,该数据集专为野外未见模板文档图像的关键信息抽取评估而收集与标注。它包含 25 个关键信息类别,总计约 69000 个文本框,约为现有公共数据集的 2 倍。大量实验验证了包括视觉特征、文本特征和空间关系在内的所有信息均有助于关键信息抽取。已表明 SDMG-R 能有效从未见模板的文档图像中抽取关键信息,并在近期流行的基准 SROIE 和我们的 WildReceipt 上取得新的 SOTA 结果。我们的代码与数据集将公开发布。
引用
@article{arxiv.2103.14470,
title = {Spatial Dual-Modality Graph Reasoning for Key Information Extraction},
author = {Hongbin Sun and Zhanghui Kuang and Xiaoyu Yue and Chenhao Lin and Wayne Zhang},
journal= {arXiv preprint arXiv:2103.14470},
year = {2021}
}