中文

重新审视基于检测的可视富文档图像表格结构识别

计算机视觉与模式识别 2024-01-11 v2 信息检索

摘要

表格结构识别(Table Structure Recognition, TSR)是一项被广泛讨论的任务,旨在将非结构化表格图像转换为结构化格式(如 HTML 序列),以使 ChatGPT 等仅文本模型能够进一步处理这些表格。一类解决方案是使用检测模型检测表格组件(如列与行),然后应用基于规则的后处理方法将检测结果转换为 HTML 序列。然而,现有基于检测的模型在单元格级 TSR 指标(如 TEDS)上通常表现不如其他类型解决方案,且限制这些模型在 TSR 任务上性能的深层原因也未被充分探究。因此,我们全面重访现有基于检测的模型,并探究阻碍这些模型性能的潜在原因,包括不当的问题定义、检测与 TSR 指标的不匹配问题、检测模型的特征以及局部与长程特征提取的影响。基于我们的分析与发现,我们采用简单方法对典型两阶段检测模型 Cascade R-CNN 进行定制以适配 TSR 任务。实验结果表明,定制后的基于 Cascade R-CNN 的模型在 FinTabNet 数据集上仅结构 TEDS 指标较基础 Cascade R-CNN 模型提升 16.35%,优于其他类型的先进方法,证明我们的发现可作为改进基于检测的 TSR 模型的指导,且纯基于检测的解决方案与其他类型解决方案(如基于图与图像到序列的解决方案)具有竞争力。

关键词

引用

@article{arxiv.2312.00699,
  title  = {Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images},
  author = {Bin Xiao and Murat Simsek and Burak Kantarci and Ala Abu Alkheir},
  journal= {arXiv preprint arXiv:2312.00699},
  year   = {2024}
}

备注

under review