中文

SEMv2:基于实例分割的表格分隔线检测

计算机视觉与模式识别 2024-01-15 v2

摘要

表格结构识别是使机器理解表格不可或缺的元素,其主要目的是识别表格的内部结构。然而,由于其结构与样式的复杂性和多样性,将表格数据解析为机器可理解的结构化格式极具挑战性。本文遵循基于分而治之(split-and-merge)方法的原理,提出一种准确的表格结构识别器,称为SEMv2(SEM:Split, Embed and Merge)。与先前工作在“split”阶段不同,我们旨在解决表格分隔线实例级判别问题,并引入一种基于条件卷积的表格分隔线检测策略。具体而言,我们以自顶向下的方式设计“split”,先检测表格分隔线实例,然后为每个实例动态预测表格分隔线掩码。最终的表格分隔线形状可通过按行/列方式处理表格分隔线掩码准确获得。为全面评估SEMv2,我们还提出一个更具挑战性的表格结构识别数据集,称为iFLYTAB,其涵盖照片、扫描文档等多种场景中的多风格表格。在公开可用数据集(如SciTSR、PubTabNet和iFLYTAB)上的大量实验证明了我们所提方法的有效性。代码与iFLYTAB数据集见 https://github.com/ZZR8066/SEMv2。

关键词

引用

@article{arxiv.2303.04384,
  title  = {SEMv2: Table Separation Line Detection Based on Instance Segmentation},
  author = {Zhenrong Zhang and Pengfei Hu and Jiefeng Ma and Jun Du and Jianshu Zhang and Huihui Zhu and Baocai Yin and Bing Yin and Cong Liu},
  journal= {arXiv preprint arXiv:2303.04384},
  year   = {2024}
}