中文

TabLib:一个含上下文的6.27亿表格数据集

计算与语言 2023-10-13 v1 人工智能 数据库 机器学习

摘要

众所周知,大型多样化数据集对现代文本与图像模态AI系统的性能起着关键作用。然而,在表格数据方面,尚无规模与多样性可与文本和图像可用数据集相比拟的数据集。因此我们提出“TabLib”,其包含总计69 TiB的6.27亿个表格,以及867B tokens的上下文。TabLib从众多文件格式中提取,包括CSV、HTML、SQLite、PDF、Excel等,源自由GitHub与Common Crawl。TabLib的规模与多样性在表格模态上展现出可观前景,令人联想到文本与图像基础数据集(如The Pile与LAION)最初的承诺。

关键词

引用

@article{arxiv.2310.07875,
  title  = {TabLib: A Dataset of 627M Tables with Context},
  author = {Gus Eggert and Kevin Huo and Mike Biven and Justin Waugh},
  journal= {arXiv preprint arXiv:2310.07875},
  year   = {2023}
}