中文

CUTIE:利用卷积通用文本信息提取器学习理解文档

计算机视觉与模式识别 2019-06-21 v4 人工智能

摘要

从收据或发票等文档中提取关键信息,并将感兴趣文本保存为结构化数据,在会计、金融和税务等领域(但不限于此)的办公自动化文档密集型流程中至关重要。为避免为每种特定类型文档设计专家规则,已有发表的工作尝试通过在学习 Named Entity Recognition (NER,命名实体识别) 方法(自然语言处理领域)的基础上学习模型以探索文本序列中的语义上下文来解决该问题。本文提出利用文档中文本的语义含义与空间分布中的有效信息。具体而言,我们提出的模型 Convolutional Universal Text Information Extractor (CUTIE,卷积通用文本信息提取器) 将卷积神经网络应用于网格化文本,其中文本作为具有语义内涵的特征被嵌入。我们进一步探究采用不同卷积神经网络结构的效果,并提出一种快速且可移植的结构。我们在多达 4,4844,484 张标注收据的数据集上证明了所提方法的有效性,无需任何预训练或后处理,在速度和精度方面均取得远优于基于 NER 方法的 state of the art (SOTA,最先进) 性能。实验结果还表明,所提出的 CUTIE 模型能够在更少量训练数据下取得良好性能。

关键词

引用

@article{arxiv.1903.12363,
  title  = {CUTIE: Learning to Understand Documents with Convolutional Universal Text Information Extractor},
  author = {Xiaohui Zhao and Endi Niu and Zhuo Wu and Xiaoguang Wang},
  journal= {arXiv preprint arXiv:1903.12363},
  year   = {2019}
}