FormNet:表单文档信息抽取中超越序列建模的结构编码
计算与语言
2022-03-25 v2 计算机视觉与模式识别
机器学习
摘要
序列建模在自然语言和文档理解任务上已展现出最先进的性能。然而,由于表单类文档布局模式多样,在实践中正确地序列化其中的词元颇具挑战。我们提出 FormNet,一种结构感知的序列模型,以缓解表单的次优序列化问题。首先,我们设计了 Rich Attention,利用表单中词元之间的空间关系进行更精确的注意力分数计算。其次,我们通过图卷积将相邻词元的表示嵌入,为每个词构建超级词元(Super-Tokens)。因此,FormNet 显式地恢复了在序列化过程中可能丢失的局部句法信息。在实验中,FormNet 以更紧凑的模型规模和更少的预训练数据优于现有方法,在 CORD、FUNSD 和 Payment 基准上确立了新的最先进性能。
引用
@article{arxiv.2203.08411,
title = {FormNet: Structural Encoding beyond Sequential Modeling in Form Document Information Extraction},
author = {Chen-Yu Lee and Chun-Liang Li and Timothy Dozat and Vincent Perot and Guolong Su and Nan Hua and Joshua Ainslie and Renshen Wang and Yasuhisa Fujii and Tomas Pfister},
journal= {arXiv preprint arXiv:2203.08411},
year = {2022}
}
备注
Accepted to ACL 2022