中文

真实场景下的视觉信息提取:实用数据集与端到端方案

计算机视觉与模式识别 2023-06-16 v2

摘要

视觉信息提取(VIE)旨在以统一框架同时执行 OCR 与信息提取,因其在收据、商品、交通标志等理解应用中的关键作用而受到越来越多的关注。然而,现有 VIE 基准数据集主要由文档图像构成,在版面结构、背景干扰和实体类别上缺乏足够多样性,无法充分揭示真实世界应用所面临的挑战。本文提出一个由相机图像组成的大规模 VIE 数据集,其不仅包含更大的版面、背景与字体差异,还包含更多类型的实体。此外,我们提出一种新颖的端到端 VIE 框架,以端到端学习的方式将 OCR 与信息提取阶段相结合。与以往直接采用 OCR 特征作为信息提取模块输入的端到端方法不同,我们提出使用对比学习来缩小因 OCR 与信息提取任务差异所导致的语义鸿沟。我们在所提数据集上评估了现有的端到端 VIE 方法,并观察到由于版面与实体差异更大,这些方法的性能从 SROIE(一个广泛使用的英文数据集)到我们所提数据集出现了明显下降。这些结果证明我们的数据集对于推动先进的 VIE 算法更具实用性。此外,实验表明所提 VIE 方法在所提数据集与 SROIE 数据集上均持续取得明显的性能提升。

关键词

引用

@article{arxiv.2305.07498,
  title  = {Visual Information Extraction in the Wild: Practical Dataset and End-to-end Solution},
  author = {Jianfeng Kuang and Wei Hua and Dingkang Liang and Mingkun Yang and Deqiang Jiang and Bo Ren and Xiang Bai},
  journal= {arXiv preprint arXiv:2305.07498},
  year   = {2023}
}

备注

15 pages, 6 figures, ICDAR2023