用于少样本视觉信息抽取的生成式排版器
计算机视觉与模式识别
2025-03-24 v1
摘要
视觉信息抽取(VIE)旨在从视觉丰富的文档图像中抽取结构化信息,在文档处理中起着关键作用。考虑到布局、语义范围与语言的多样性,VIE 涵盖了广泛的类型,潜在数量可达数千种。然而,其中许多类型面临训练数据匮乏的问题,构成了重大挑战。在本文中,我们提出一种新颖的生成模型,称为生成式排版器(Generative Compositor),以应对少样本 VIE 的挑战。生成式排版器是一种混合指针-生成网络,通过从源文本中检索词语并依据所给提示进行组装,模拟排版器的操作。此外,我们采用三种预训练策略以增强模型对空间上下文信息的感知。同时,专门设计了一个提示感知重采样器,利用提示中所包含的实体语义先验实现高效匹配。基于提示的检索机制与预训练策略的引入,使模型能够在有限训练样本下获取更有效的空间与语义线索。实验表明,所提方法在全样本训练下取得了极具竞争力的结果,并在 1-shot、5-shot 与 10-shot 设置下显著优于基线。
引用
@article{arxiv.2503.16854,
title = {Generative Compositor for Few-Shot Visual Information Extraction},
author = {Zhibo Yang and Wei Hua and Sibo Song and Cong Yao and Yingying Zhu and Wenqing Cheng and Xiang Bai},
journal= {arXiv preprint arXiv:2503.16854},
year = {2025}
}