中文

一种基于问答的表单类文档图像键值对提取方法

计算与语言 2023-04-18 v1

摘要

本文提出一种基于问答(QA)的键值对提取新方法,称为 KVPFormer,用于从表单类文档图像中鲁棒地提取实体间的键值关系。具体而言,KVPFormer 首先用 Transformer 编码器从图像中的所有实体中识别关键实体,然后将这些关键实体作为\textbf{问题}输入 Transformer 解码器,并行预测其对应的\textbf{答案}(即值实体)。为获得更高的答案预测准确率,我们进一步提出由粗到细的答案预测方法:在粗阶段为每个识别出的问题提取多个答案候选,在细阶段从这些候选中选出最可能的一个。以此方式,可有效降低答案预测的学习难度,从而提高预测准确率。此外,我们在自注意力/交叉注意力机制中引入空间兼容性注意力偏置,以使模型更好地建模实体间的空间交互。借助这些新技术,我们提出的 KVPFormer 在 FUNSD 和 XFUND 数据集上取得了最先进的结果,F1 分数分别比之前最佳方法高出 7.2% 和 13.2%。

关键词

引用

@article{arxiv.2304.07957,
  title  = {A Question-Answering Approach to Key Value Pair Extraction from Form-like Document Images},
  author = {Kai Hu and Zhuoyuan Wu and Zhuoyao Zhong and Weihong Lin and Lei Sun and Qiang Huo},
  journal= {arXiv preprint arXiv:2304.07957},
  year   = {2023}
}

备注

AAAI 2023