中文

视觉富文档中作为依存句法分析的实体关系抽取

计算与语言 2021-10-20 v1 人工智能 机器学习

摘要

以往从视觉富文档(VRDs)中抽取关键信息的工作主要关注标注每个边界框内的文本(即语义实体),而实体间的关系则很大程度上未被探索。本文将流行的依存句法分析模型——双仿解析器(biaffine parser)——适配于该实体关系抽取任务。与识别词间依存关系的原始依存句法分析模型不同,我们转而利用布局信息识别词组之间的关系。我们比较了语义实体的不同表示、不同的 VRD 编码器以及不同的关系解码器。结果表明,所提模型在 FUNSD 数据集上取得了 65.96% 的 F1 分数。在实际应用方面,我们的模型已应用于内部海关数据,在生产环境中取得了可靠性能。

关键词

引用

@article{arxiv.2110.09915,
  title  = {Entity Relation Extraction as Dependency Parsing in Visually Rich Documents},
  author = {Yue Zhang and Bo Zhang and Rui Wang and Junjie Cao and Chen Li and Zuyi Bao},
  journal= {arXiv preprint arXiv:2110.09915},
  year   = {2021}
}

备注

Accepted to EMNLP 2021 (main conference)