中文

SynFinTabs:用于信息与表格抽取的合成金融表格数据集

机器学习 2024-12-06 v1

摘要

从文档图像中抽取表格是一项具有挑战性的 AI 问题,而许多内容领域的标记数据难以获得。现有表格抽取数据集通常侧重于科学表格,因为学术文章及其源代码在可获取性上具有显著优势。然而,科学表格与金融表格以及其他领域的表格在布局和排版差异方面存在显著差异。当前数据集往往缺乏表格中包含的文字及其位置,而是依赖不可靠的 OCR 提取这些特征来训练现代机器学习模型处理自然语言处理任务。因此,需要更通用的方法来获取标记数据。我们提出了 SynFinTabs,一个大规模的合成金融表格标记数据集。我们希望该数据集生成方法可被移植到其他领域。为演示该数据集在训练从表格图像中提取信息的模型方面的有效性,我们创建了 FinTabQA,一个在抽取性问答任务上训练的布局大语言模型。我们使用真实世界的金融表格对模型进行测试,并与一个最先进的生成模型进行比较,讨论了结果。我们公开了数据集、模型及数据集生成代码。

关键词

引用

@article{arxiv.2412.04262,
  title  = {SynFinTabs: A Dataset of Synthetic Financial Tables for Information and Table Extraction},
  author = {Ethan Bradley and Muhammad Roman and Karen Rafferty and Barry Devereux},
  journal= {arXiv preprint arXiv:2412.04262},
  year   = {2024}
}

备注

12 pages, 8 figures