中文

面向真实场景的鲁棒视觉信息提取:新数据集与新方法

计算机视觉与模式识别 2021-02-16 v1 人工智能 信息检索 机器学习 多媒体

摘要

视觉信息提取(VIE)因其在文档理解、自动阅卷和智能教育等多种高级应用而近期备受关注。现有多数工作将该问题解耦为文本 spotting(文本检测与识别)和信息提取几个独立的子任务,在优化过程中完全忽略了它们之间的高度相关性。本文提出一种面向真实场景的鲁棒视觉信息提取系统(VIES),这是一个统一的端到端可训练框架,以单张文档图像为输入、输出结构化信息,可同时完成文本检测、识别与信息提取。具体而言,信息提取分支从文本 spotting 中收集丰富的视觉与语义表征以进行多模态特征融合,反之也为文本 spotting 的优化提供更高层次的语义线索。此外,针对公开基准缺失的问题,我们构建了一个全标注数据集 EPHOIE(https://github.com/HCIILAB/EPHOIE),这是首个同时面向文本 spotting 与视觉信息提取的中文基准。EPHOIE 包含 1,494 张布局与背景复杂的试卷头部图像,共计 15,771 个中文手写或印刷文本实例。与当前最优方法相比,我们的 VIES 在 EPHOIE 数据集上表现出显著更优的性能,并在广泛使用的 SROIE 数据集上端到端场景下取得了 9.01% 的 F 值提升。

关键词

引用

@article{arxiv.2102.06732,
  title  = {Towards Robust Visual Information Extraction in Real World: New Dataset and Novel Solution},
  author = {Jiapeng Wang and Chongyu Liu and Lianwen Jin and Guozhi Tang and Jiaxin Zhang and Shuaitao Zhang and Qianying Wang and Yaqiang Wu and Mingxiang Cai},
  journal= {arXiv preprint arXiv:2102.06732},
  year   = {2021}
}

备注

8 pages, 5 figures, to be published in AAAI 2021