UniTabE:数据科学中表格基础模型的通用预训练协议
机器学习
2024-03-14 v2 人工智能
计算与语言
摘要
自然语言处理(NLP)近期的进展见证了预训练模型的开创性影响,在各类任务上取得了令人印象深刻的成果。本研究旨在将预训练方法的威力拓展至促进数据科学中表格的预测,该领域传统上被忽视,但由于不同任务固有的大量表格模式而极具挑战性。支撑本工作的核心研究问题围绕以下方面展开:为具有不同结构的表格建立通用预训练协议、所学知识跨任务的泛化与可迁移性、对多样化下游应用的适配,以及随时间增量列信息的引入。为应对这些挑战,我们提出 UniTabE,一种简洁而有效的方法,旨在以统一方式处理表格,不受特定表格结构约束。UniTabE 的核心概念在于以称为 TabUnit 的模块表示每个基本表格元素,随后由 Transformer 编码器精炼其表示。此外,我们的模型旨在通过自由形式提示(free-form prompts)实现预训练与微调。为实施预训练阶段,我们精心构建了一个包含约 13B 样本的大规模表格数据集, meticulous 采集自 Kaggle 平台。本研究主要关注涉及表格数据的分类与回归任务,并进行了严格的实验测试与分析以验证方法有效性。实验结果表明,UniTabE 在多个大规模基准上相较若干基线具有更优性能,从而凸显其显著增强表格数据语义表示的潜力,标志着表格数据分析的重要一步。
引用
@article{arxiv.2307.09249,
title = {UniTabE: A Universal Pretraining Protocol for Tabular Foundation Model in Data Science},
author = {Yazheng Yang and Yuqi Wang and Guang Liu and Ledell Wu and Qi Liu},
journal= {arXiv preprint arXiv:2307.09249},
year = {2024}
}
备注
ICLR 2024, 9 pages