RDU:一种基于区域的表单式文档理解方法
人工智能
2022-06-15 v1 计算与语言
摘要
关键信息抽取(Key Information Extraction, KIE)旨在从表单式文档(如发票)中抽取结构化信息(如键值对),是迈向智能文档理解的重要一步。以往方法通常通过序列标注处理KIE,难以处理非扁平序列,尤其对文本表格混合文档。这些方法还受制于为每类文档预定义固定标签集合以及标签不平衡问题。本工作中,我们假设光学字符识别(Optical Character Recognition, OCR)已应用于输入文档,并将KIE任务重新表述为给定目标字段下二维(2D)空间中的区域预测问题。遵循这一新设定,我们开发了名为基于区域的文档理解(Region-based Document Understanding, RDU)的新KIE模型,其以文档的文本内容和对应坐标为输入,试图通过定位类边界框区域来预测结果。我们的RDU首先应用带有软布局注意力掩码与偏置机制的布局感知BERT,将布局信息融入表示;随后,受计算机视觉中广泛用于目标检测模型启发,通过区域提议模块从表示中生成候选区域列表;最后,采用区域分类模块与区域选择模块分别判断提议区域是否有效并从所有提议区域中选择概率最大者。在四类表单式文档上的实验表明,我们所提方法可取得令人印象深刻的結果。此外,我们的RDU模型可无缝地以不同文档类型训练,对低资源文档尤为有益。
引用
@article{arxiv.2206.06890,
title = {RDU: A Region-based Approach to Form-style Document Understanding},
author = {Fengbin Zhu and Chao Wang and Wenqiang Lei and Ziyang Liu and Tat Seng Chua},
journal= {arXiv preprint arXiv:2206.06890},
year = {2022}
}
备注
Work in process