中文

基于 LayoutLMv3 的视觉丰富文档关系抽取增强模型

计算与语言 2024-04-18 v1 人工智能 机器学习

摘要

文档理解是自然语言处理(NLP)中的一个不断演化的领域。特别是,除了原始文本本身外,视觉和空间特征对于视觉文档理解(VDU)中的几个多模态模型至关重要。然而,尽管研究主要聚焦于关键信息抽取(KIE),但在识别实体之间的关系抽取(RE)仍受到不足的关注。例如,RE 对重新组织实体或获取文档数据的全面层次结构至关重要。本文提出了一个模型,可从 LayoutLMv3 初始化,可在无需特定预训练且参数更少的情况下匹配或超越当前在 FUNSD 和 CORD 数据集上用于视觉丰富文档(VRD)的当前最先进结果。我们还报告了在 FUNSD 上进行的大规模消除实验,突出了某些特征和模型化选择对性能的巨大影响。

关键词

引用

@article{arxiv.2404.10848,
  title  = {A LayoutLMv3-Based Model for Enhanced Relation Extraction in Visually-Rich Documents},
  author = {Wiam Adnan and Joel Tang and Yassine Bel Khayat Zouggari and Seif Edinne Laatiri and Laurent Lam and Fabien Caspani},
  journal= {arXiv preprint arXiv:2404.10848},
  year   = {2024}
}

备注

Accepted at the International Conference on Document Analysis and Recognition (ICDAR 2024)