GeoLayoutLM:面向视觉信息抽取的几何预训练
计算机视觉与模式识别
2023-04-24 v1 计算与语言
摘要
视觉信息抽取(VIE)在文档智能中扮演重要角色。通常其被分为两项任务:语义实体识别(SER)与关系抽取(RE)。近期,文档预训练模型在VIE尤其是SER上已取得实质性进展。然而,现有多数模型以隐式方式学习几何表示,已发现其对RE任务不足,因为几何信息对RE尤为关键。此外,我们揭示限制RE性能的另一因素在于RE的预训练阶段与微调阶段间的目标鸿沟。为解决这些问题,本文提出一种多模态框架GeoLayoutLM用于VIE。GeoLayoutLM在预训练中显式建模几何关系,我们称之为几何预训练。几何预训练通过三个专门设计的几何相关预训练任务实现。此外,精心设计了由几何预训练任务预训练并针对RE微调的新颖关系头,以丰富并增强特征表示。根据在标准VIE基准上的大量实验,GeoLayoutLM在SER任务上取得极具竞争力的分数,并在RE上显著优于先前最先进水平(\eg,FUNSD上RE的F1分数从80.35%提升至89.45%)。代码与模型公开于https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/DocumentUnderstanding/GeoLayoutLM
引用
@article{arxiv.2304.10759,
title = {GeoLayoutLM: Geometric Pre-training for Visual Information Extraction},
author = {Chuwei Luo and Changxu Cheng and Qi Zheng and Cong Yao},
journal= {arXiv preprint arXiv:2304.10759},
year = {2023}
}
备注
CVPR 2023 Highlight