TabLib:一个含上下文的6.27亿表格数据集
计算与语言
2023-10-13 v1 人工智能
数据库
机器学习
摘要
众所周知,大型多样化数据集对现代文本与图像模态AI系统的性能起着关键作用。然而,在表格数据方面,尚无规模与多样性可与文本和图像可用数据集相比拟的数据集。因此我们提出“TabLib”,其包含总计69 TiB的6.27亿个表格,以及867B tokens的上下文。TabLib从众多文件格式中提取,包括CSV、HTML、SQLite、PDF、Excel等,源自由GitHub与Common Crawl。TabLib的规模与多样性在表格模态上展现出可观前景,令人联想到文本与图像基础数据集(如The Pile与LAION)最初的承诺。
引用
@article{arxiv.2310.07875,
title = {TabLib: A Dataset of 627M Tables with Context},
author = {Gus Eggert and Kevin Huo and Mike Biven and Justin Waugh},
journal= {arXiv preprint arXiv:2310.07875},
year = {2023}
}