中文

对齐表格结构识别的基准数据集

计算机视觉与模式识别 2023-05-25 v2 机器学习

摘要

表格结构识别(TSR)的基准数据集必须仔细处理以确保标注的一致性。然而,即便某数据集的标注自身一致,跨数据集仍可能存在显著不一致,这会损害在其上训练与评估的模型性能。本工作中,我们表明对齐这些基准——消除它们之间的错误与不一致——可显著提升模型性能。我们通过一种以数据为中心的方法证明这一点:我们采用一种始终固定的模型架构,即 Table Transformer (TATR)。当在 PubTables-1M 上训练时,TATR 在 ICDAR-2013 基准上的基线精确匹配准确率为 65%,在 FinTabNet 上训练时为 42%,合并训练时为 69%。在减少标注错误与数据集间不一致后,TATR 在 ICDAR-2013 上评估的性能大幅提升至:PubTables-1M 训练时 75%,FinTabNet 训练时 65%,合并训练时 81%。我们通过针对修改步骤的消融实验表明,表格标注的规范化对性能有显著正向影响,而其他选择平衡了决定基准数据集最终构成时出现的必要权衡。总体而言,我们认为本工作对 TSR 及潜在其他任务的基准设计具有重要意义。数据集处理与训练代码将于 https://github.com/microsoft/table-transformer 发布。

关键词

引用

@article{arxiv.2303.00716,
  title  = {Aligning benchmark datasets for table structure recognition},
  author = {Brandon Smock and Rohith Pesala and Robin Abraham},
  journal= {arXiv preprint arXiv:2303.00716},
  year   = {2023}
}