从监督式到生成式:基于大语言模型的表格深度学习新范式
机器学习
2024-07-12 v4
摘要
表格数据在医疗、金融、零售、可持续发展等多个关键行业的预测建模中具有基础性地位。尽管专用模型已取得进展,但对能够迁移知识、从有限数据泛化并遵循人类指令的通用模型的需求日益增长。这些是当前表格深度学习方法尚未完全应对的挑战。本文提出生成式表格学习(Generative Tabular Learning, GTL),一种将大语言模型(LLMs)的先进功能(如基于提示的零样本泛化与上下文学习)融入表格深度学习的新框架。GTL 利用 LLM 在多样化表格数据上的预训练,增强其对领域知识、数值序列和统计依赖关系的理解,这些对准确预测至关重要。我们的实证研究涵盖 384 个公共数据集,严格分析了 GTL 的收敛与缩放行为,并评估了不同数据模板的影响。经 GTL 增强的 LLaMA-2 模型在众多分类与回归任务中展现出优越的零样本与上下文学习能力。值得注意的是,它无需微调即实现此能力,超越传统方法,并在某些情况下媲美 GPT-4 等最先进模型。通过 GTL,我们不仅促进了 LLM 复杂能力在表格数据理解与应用中的更深融合,也为 LLM 提供了提升其表格数据理解能力的新训练资源与测试平台。为便于可复现研究,我们在 https://github.com/microsoft/Industrial-Foundation-Models 发布了代码、数据与模型检查点。
引用
@article{arxiv.2310.07338,
title = {From Supervised to Generative: A Novel Paradigm for Tabular Deep Learning with Large Language Models},
author = {Xumeng Wen and Han Zhang and Shun Zheng and Wei Xu and Jiang Bian},
journal= {arXiv preprint arXiv:2310.07338},
year = {2024}
}
备注
Accepted by KDD 2024