中文

SPRINT: 表格中脚本无关的结构识别

计算机视觉与模式识别 2025-03-18 v1

摘要

表格结构识别(TSR)对于信息检索、表格重建和文档理解等各种下游任务至关重要。虽然大多数最先进(SOTA)研究主要关注英文文档中的 TSR,但考虑到全球数据的多样性,其他语言中类似能力的需求是显而易见的。此外,在非英语语言中创建大量标注数据并从头训练这些 SOTA 模型既昂贵又耗时。我们将 TSR 提出为语言无关的单元格排列预测,并引入 SPRINT(Script-agnostic Structure Recognition in Tables)。SPRINT 使用最近引入的优化表格结构语言(OTSL)序列来预测表格结构。我们证明,当与预训练的表格网格估计器结合时,SPRINT 可以提高表格的整体基于树编辑距离的相似结构得分,即使对于非英文文档也是如此。我们在包括 PubTabNet、FinTabNet 和 PubTables-1M 在内的基准 TSR 数据集上实验评估了我们的性能。我们的结果表明,SPRINT 不仅在标准数据集上的性能与 SOTA 模型相当,而且表现出更低的延迟。此外,SPRINT 在准确识别非英文文档中的表格结构方面表现出色,通过显示绝对平均增长 11.12% 超越了当前领先模型。我们还提出了一种将有效的 OTSL 预测转换为广泛使用的基于 HTML 的表格表示的算法。为了鼓励进一步研究,我们在 https://github.com/IITB-LEAP-OCR/SPRINT 发布了我们的代码和 Multilingual Scanned and Scene Table Structure Recognition Dataset(MUSTARD),该数据集用 OTSL 序列标注了 13 种语言中 1428 个表格,涵盖多种脚本。

关键词

引用

@article{arxiv.2503.11932,
  title  = {SPRINT: Script-agnostic Structure Recognition in Tables},
  author = {Dhruv Kudale and Badri Vishal Kasuba and Venkatapathy Subramanian and Parag Chaudhuri and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2503.11932},
  year   = {2025}
}

备注

Accepted at ICDAR 2024