通过语言建模进行大规模表格数据迁移学习
机器学习
2024-11-22 v2 人工智能
计算与语言
摘要
表格数据——结构化、异构的、带有行列的电子表格样式数据——在诸多领域中广泛应用。然而,尽管近期的基础模型在语言建模和计算机视觉等领域显著减少了开发任务特定数据集和预测器的需求,但这种迁移学习范式在表格领域尚未产生类似影响。本文旨在缩小这一差距,提出 TabuLa-8B,这是一个用于表格预测的语言模型。我们定义了从 TabLib 语料库中提取大规模高质量训练数据的过程,提出了表格数据过滤和质量控制的方法。借助由此构成的数据集(包含来自 400 万多个独立表格的 21 亿行以上数据),我们使用一种 novel 的打包和注意力方案,对 Llama 3-8B 大语言模型进行微调,以实现表格数据预测(分类和分箱回归)。通过在 329 个数据集上的评估,我们发现 TabuLa-8B 在未见表格上的零样本准确率比随机猜测高出 15 个百分点以上,而现有最先进的表格预测模型(如 XGBoost、TabPFN)无法实现。 在少样本场景(1-32 样本)下,TabuLa-8B 在目标数据集上无需任何微调,相较于 XGBoost 和 TabPFN 模型(这些模型在相同数据量或最多 16 倍数据上都经过训练),准确率高出 5-15 个百分点。我们随本论文一并发布模型、代码和数据。
引用
@article{arxiv.2406.12031,
title = {Large Scale Transfer Learning for Tabular Data via Language Modeling},
author = {Josh Gardner and Juan C. Perdomo and Ludwig Schmidt},
journal= {arXiv preprint arXiv:2406.12031},
year = {2024}
}
备注
NeurIPS 2024 camera-ready updates