PEneo:统一行提取、行分组与实体链接以实现端到端文档对提取
计算与语言
2024-11-19 v3
摘要
文档对提取旨在从视觉丰富的文档中识别键值实体及其关系。大多数现有方法将其分为两个独立的任务:语义实体识别(SER)和关系提取(RE)。然而,简单地串行连接 SER 和 RE 会导致严重的错误传播,并且无法处理现实场景中的多行实体等情况。为了解决这些问题,本文引入了一种新颖的框架 PEneo(Pair Extraction new decoder option),它在统一管道中执行文档对提取,包含三个并发子任务:行提取、行分组和实体链接。这种方法缓解了错误累积问题,并能处理多行实体的情况。此外,为了更好地评估模型性能并促进未来对对提取的研究,我们引入了 RFUND,这是常用 FUNSD 和 XFUND 数据集的重新标注版本,使其更准确并覆盖现实情况。在各种基准上的实验表明,PEneo 优于之前的管道,当与 LiLT 和 LayoutLMv3 等各种骨干网络结合时,性能大幅提升(例如在 RFUND-EN 上 F1 分数提升 19.89%-22.91%),展示了其有效性和通用性。代码和新标注可在 https://github.com/ZeningLin/PEneo 获取。
引用
@article{arxiv.2401.03472,
title = {PEneo: Unifying Line Extraction, Line Grouping, and Entity Linking for End-to-end Document Pair Extraction},
author = {Zening Lin and Jiapeng Wang and Teng Li and Wenhui Liao and Dayi Huang and Longfei Xiong and Lianwen Jin},
journal= {arXiv preprint arXiv:2401.03472},
year = {2024}
}
备注
Accepted by ACM MM 2024