中文

用于文本与图像文档分类的多模态深度网络

计算机视觉与模式识别 2019-07-16 v1

摘要

文档图像的分类是老旧手稿归档、在线订阅与行政流程中的关键步骤。计算机视觉与深度学习已被提议作为依据视觉外观对文档分类的初步方案。然而,真实场景所需的细粒度分类无法仅依靠视觉分析实现。相关信息常位于文档的实际文本内容中。我们设计了一个能够从 OCR 提取文本上计算的词嵌入与图像中学习的多模态神经网络。我们表明,即便没有干净文本信息,该方法在由我们新 QS-OCR 文本数据集 (https://github.com/Quicksign/ocrized-text-dataset) 增强的 Tobacco3482 与 RVL-CDIP 上也将纯图像准确率提升了 3%。

关键词

引用

@article{arxiv.1907.06370,
  title  = {Multimodal deep networks for text and image-based document classification},
  author = {Nicolas Audebert and Catherine Herold and Kuider Slimani and Cédric Vidal},
  journal= {arXiv preprint arXiv:1907.06370},
  year   = {2019}
}