中文

从表格到LaTeX:科学表格的结构与内容提取

信息检索 2022-11-01 v1 人工智能 计算机视觉与模式识别

摘要

科学文档中包含以简明方式列出重要信息的表格。从嵌入 PDF 研究文档中的表格提取结构与内容是一项非常具有挑战性的任务,原因在于存在跨单元格等视觉特征以及数学符号与方程等内容特征。大多数现有的表格结构识别方法往往忽略这些学术写作特征。本文中,我们调整基于 Transformer 的语言建模范式用于科学表格的结构与内容提取。具体而言,所提出的模型将表格图像转换为其对应的 LaTeX 源代码。总体上,我们优于当前最先进的基线,在表格结构与内容提取上分别取得了 70.35% 和 49.69% 的精确匹配准确率。进一步的分析表明,所提出的模型能有效识别行数与列数、字母数字字符、LaTeX 标记以及符号。

关键词

引用

@article{arxiv.2210.17246,
  title  = {Tables to LaTeX: structure and content extraction from scientific tables},
  author = {Pratik Kayal and Mrinal Anand and Harsh Desai and Mayank Singh},
  journal= {arXiv preprint arXiv:2210.17246},
  year   = {2022}
}

备注

10 pages, published in IJDAR'22. arXiv admin note: text overlap with arXiv:2105.14426