中文

UniPredict:大语言模型是通用表格分类器

机器学习 2024-01-18 v2

摘要

表格数据预测是许多应用中的基础机器学习任务。现有方法主要采用判别建模,并假设目标列固定,因而每个新预测任务都需重新训练。受大语言模型(LLMs)生成能力启发,本文利用基于生成建模构建通用表格数据预测器的思路,即 UniPredict。在此,我们展示了 LLM 对大规模表格数据集的可扩展性,使其能理解多样化表格输入并依据所给指令预测目标变量。具体地,我们在聚合的 169 个具有不同目标的表格数据集上训练单一 LLM,并将其性能与在每个数据集上分别训练的基线比较。我们观察到这一多用途的 UniPredict 模型相较最佳树提升基线和最佳神经网络基线分别具有 5.4% 至 13.4% 的优势。我们进一步在另外 62 个表格数据集上以少样本学习设置测试 UniPredict。我们的方法在快速适应新任务上取得强劲性能。在低资源少样本设置中,我们观察到相较 XGBoost 有 100% 以上的性能优势,且显著优于所有基线。我们设想 UniPredict 为开发从大规模数据学习并服务广泛预测任务的通用表格数据预测系统指明方向。

关键词

引用

@article{arxiv.2310.03266,
  title  = {UniPredict: Large Language Models are Universal Tabular Classifiers},
  author = {Ruiyu Wang and Zifeng Wang and Jimeng Sun},
  journal= {arXiv preprint arXiv:2310.03266},
  year   = {2024}
}