基于弱监督方法重新思考图像表格识别
计算机视觉与模式识别
2023-03-16 v1
摘要
以往大多数表格识别方法依赖于包含大量丰富标注表格图像的训练数据集。然而,详细的表格图像标注(例如单元格或文本边界框标注)成本高且常带有主观性。在本文中,我们提出一种名为 WSTabNet 的弱监督表格识别模型,仅依赖表格图像的 HTML(或 LaTeX)代码级标注。所提模型由三部分组成:用于特征提取的编码器、用于生成表格结构的结解码器,以及用于预测表格中每个单元格内容的单元格解码器。我们的系统通过随机梯度下降算法端到端训练,仅需表格图像及其真实 HTML(或 LaTeX)表示。为促进基于深度学习的表格识别,我们创建并发布了 WikiTableSet——从维基百科构建的最大公开可用图像表格识别数据集。WikiTableSet 包含近 400 万张英文表格图像、59 万张日文表格图像和 64 万张法文表格图像,并带有相应的 HTML 表示和单元格边界框。在 WikiTableSet 及两个大规模数据集 FinTabNet 和 PubTabNet 上的大量实验表明,所提弱监督模型在所有基准数据集上取得了优于或类似于 SOTA 模型的精度。
引用
@article{arxiv.2303.07641,
title = {Rethinking Image-based Table Recognition Using Weakly Supervised Methods},
author = {Nam Tuan Ly and Atsuhiro Takasu and Phuc Nguyen and Hideaki Takeda},
journal= {arXiv preprint arXiv:2303.07641},
year = {2023}
}
备注
10 pages, ICPRAM2023