中文

视觉 FUDGE:基于动态图编辑的表单理解

计算机视觉与模式识别 2021-07-19 v2

摘要

我们解决表单理解问题:在表单图像中寻找文本实体及其之间的关系/链接。所提出的 FUDGE 模型将这一问题建立在文本元素(顶点)的图上,并使用图卷积网络预测对图的更改。初始顶点为检测到的文本行,不一定对应于最终的文本实体,后者可跨多行。此外,初始边包含许多假阳性关系。FUDGE 通过以迭代方式合并文本段(图顶点)和剪枝边来编辑图结构,从而获得最终的文本实体和关系。尽管该领域近期工作集中于利用大规模预训练语言模型(LM),FUDGE 仅从提供的(小规模)训练集中学习视觉特征,即在 FUNSD 数据集上取得了几乎同等的实体链接性能。FUDGE 可应用于文本识别困难的表单(例如退化或历史表单)以及资源匮乏语言的表单,此类语言中预训练此类 LM 具有挑战性。FUDGE 在历史 NAF 数据集上达到最先进水平。

关键词

引用

@article{arxiv.2105.08194,
  title  = {Visual FUDGE: Form Understanding via Dynamic Graph Editing},
  author = {Brian Davis and Bryan Morse and Brian Price and Chris Tensmeyer and Curtis Wiginton},
  journal= {arXiv preprint arXiv:2105.08194},
  year   = {2021}
}

备注

Accepted at ICDAR 2021, 16 pages