使用注意力机制和置信传播的一次性文本字段标注用于结构化信息提取
计算机视觉与模式识别
2020-09-10 v1 机器学习
摘要
从文档图像中提取结构化信息通常包括三个步骤:文本检测、文本识别和文本字段标注。虽然文本检测和文本识别在文献中得到了大量研究和改进,但文本字段标注的研究较少,仍面临许多挑战。现有的基于学习的文本标注方法通常需要大量标注样本来为每种文档类型训练特定模型。然而,由于隐私问题,收集大量文档图像并进行标注是困难的,有时甚至是不可能的。为每种文档类型部署单独的模型也消耗大量资源。面对这些挑战,我们探索了文本字段标注的一次性学习。现有的用于该任务的一次性学习方法大多基于规则,难以在拥挤区域(地标很少)和由多个分离文本区域组成的字段中进行标注。为了解决这些问题,我们提出了一种新颖的深度端到端可训练的一次性文本字段标注方法,该方法利用注意力机制在文档图像之间传递布局信息。我们进一步在传递的布局信息上应用条件随机场来优化字段标注。我们收集并标注了一个真实世界的一次性字段标注数据集,包含多种文档类型,并进行了大量实验来检验所提出模型的有效性。为了促进这一方向的研究,我们将发布收集的数据集和一次性模型。
引用
@article{arxiv.2009.04153,
title = {One-shot Text Field Labeling using Attention and Belief Propagation for Structure Information Extraction},
author = {Mengli Cheng and Minghui Qiu and Xing Shi and Jun Huang and Wei Lin},
journal= {arXiv preprint arXiv:2009.04153},
year = {2020}
}
备注
9 pages