无 OCR 的文档理解 Transformer
机器学习
2022-10-07 v5 人工智能
摘要
理解文档图像(如发票)是一项核心但具有挑战性的任务,因为它需要诸如阅读文本和对文档的整体理解等复杂功能。当前的视觉文档理解(VDU)方法将阅读文本的任务外包给现成的光学字符识别(OCR)引擎,并专注于利用 OCR 输出进行理解任务。尽管这种基于 OCR 的方法已展现出有前景的性能,它们仍存在以下缺陷:1)使用 OCR 带来的高计算成本;2)OCR 模型在语言或文档类型上的不灵活性;3)OCR 错误向后续过程的传播。为解决这些问题,本文我们引入了一种名为 Donut(即 Document understanding transformer)的新型无 OCR 的 VDU 模型。作为无 OCR 的 VDU 研究的第一步,我们提出了一种简单的架构(即 Transformer)与预训练目标(即交叉熵损失)。Donut 在概念上简单却有效。通过大量实验与分析,我们表明这个简单的无 OCR 的 VDU 模型 Donut 在多个 VDU 任务上就速度与精度而言均达到了最先进的性能。此外,我们提供了一个合成数据生成器,有助于模型预训练在各种语言与领域上保持灵活。代码、训练好的模型与合成数据可在 https://github.com/clovaai/donut 获取。
引用
@article{arxiv.2111.15664,
title = {OCR-free Document Understanding Transformer},
author = {Geewook Kim and Teakgyu Hong and Moonbin Yim and Jeongyeon Nam and Jinyoung Park and Jinyeong Yim and Wonseok Hwang and Sangdoo Yun and Dongyoon Han and Seunghyun Park},
journal= {arXiv preprint arXiv:2111.15664},
year = {2022}
}
备注
ECCV 2022. (v5) update table 2 and figures; add LayoutLM and update scores with the latest test script at https://github.com/clovaai/donut