中文

CTE:一个用于语境化表格抽取的数据集

计算与语言 2023-02-14 v2 计算机视觉与模式识别

摘要

文档中的相关信息常由表格概括,帮助读者识别有用事实。大多数基准数据集支持文档版式分析或表格理解之一,但缺乏以统一方式应用这两项任务的数据。我们定义了语境化表格抽取(CTE)任务,旨在结合文档的文本语境抽取并界定表格结构。该数据集包含75k篇 fully 标注的科研论文页面,含超过35k个表格。数据搜集自PubMed Central,合并了PubTables-1M与PubLayNet数据集标注所提供的信息。该数据集可支持CTE,并为原有类别增添新类。所生成的标注可用于开发端到端流水线,涵盖文档版式分析、表格检测、结构识别与功能分析等多种任务。我们正式定义CTE与评估指标,展示可应对的子任务,并描述该数据集合的优势、局限与未来工作。标注与代码将发布于 https://github.com/AILab-UniFI/cte-dataset。

关键词

引用

@article{arxiv.2302.01451,
  title  = {CTE: A Dataset for Contextualized Table Extraction},
  author = {Andrea Gemelli and Emanuele Vivoli and Simone Marinai},
  journal= {arXiv preprint arXiv:2302.01451},
  year   = {2023}
}