中文

一种面向野外端到端表格识别的大规模数据集

计算机视觉与模式识别 2024-09-05 v1

摘要

表格识别(TR)是模式识别中的研究热点之一,旨在从图像中的表格提取信息。常见表格识别任务包括表格检测(TD)、表格结构识别(TSR)和表格内容识别(TCR)。TD 用于定位图像中的表格,TCR 识别文本内容,TSR 识别空间逻辑结构。目前,真实场景中的端到端 TR,即同时完成三个子任务,尚属未探索的研究领域。制约研究者的一个主要因素是缺乏基准数据集。为此,我们提出一个名为 Table Recognition Set(TabRecSet)的新大规模数据集,其具有源自野外多种场景的多样表格形式,并提供专用于端到端 TR 研究的完整标注。它是最大且首个用于端到端 TR 的双语数据集,包含 38.1K 个表格,其中 20.4K 为英文,17.7K 为中文。样本具有多样形式,如边框完整与不完整表格、规则与不规则表格(旋转、扭曲等)。场景在野外多种多样,从扫描到相机拍摄图像、文档到 Excel 表格、教育试卷到财务发票。标注完整,分别由用于 TD、TSR 和 TCR 的表格主体空间标注、单元格空间逻辑标注和文本内容组成。空间标注利用多边形而非大多数数据集采用的边界框或四边形。多边形空间标注更适用于野外场景中常见的不规则表格。此外,我们提出一个名为 TableMe 的可视化交互标注工具,以提升表格标注的效率与质量。

关键词

引用

@article{arxiv.2303.14884,
  title  = {A large-scale dataset for end-to-end table recognition in the wild},
  author = {Fan Yang and Lei Hu and Xinwu Liu and Shuangping Huang and Zhenghui Gu},
  journal= {arXiv preprint arXiv:2303.14884},
  year   = {2024}
}