利用深度学习集成与查询 PDF 文档中的相似表格
信息检索
2019-01-16 v1
摘要
企业产生的大量公共数据以半结构化 PDF 形式存在。从 PDF 格式的报告和其他已发布数据中提取表格数据,对于分析和聚合公司财务报告等多种数据整合目的而言颇具意义。对 PDF 格式中结构化表格数据的查询通常经由文本匹配等无结构方式处理。这主要是因为 PDF 文档的二进制格式针对版式和渲染进行了优化,而对数据的自动化解析支持不佳。此外,即便是 PDF 文件中同类型的表格,其模式、行或列标题也有所不同,这使得查询计划难以覆盖所有相关表格。本文提出一种基于深度学习的方法,以实现对 PDF 格式年报中财务表格的类 SQL 查询与分析。这通过表格类型分类和最近行搜索得以实现。我们证明,使用在 Google 新闻上训练的词嵌入进行表头匹配,明显优于传统数据库中基于文本匹配的方法。我们还介绍了一个实用系统,其利用该技术查询和分析来自不同来源的 PDF 文档中的财务表格。
引用
@article{arxiv.1901.04672,
title = {Integrating and querying similar tables from PDF documents using deep learning},
author = {Rahul Anand and Hye-Young Paik and Cheng Wang},
journal= {arXiv preprint arXiv:1901.04672},
year = {2019}
}