中文

跨表预训练:迈向异构表格数据的通用函数空间

机器学习 2024-06-04 v1 人工智能

摘要

来自不同表格的表格数据由于特征的定义和类型多样,以及复杂的特征间和特征-目标关系,表现出显著的多样性。跨数据集预训练从上游数据中学习可复用模式以支持下游任务,已在各个领域取得了显著成功。然而,当应用于表格数据预测时,由于不同表格数据集(表格)之间的可复用模式有限,以及可用于微调的表格数据普遍稀缺,这种范式面临挑战。在本研究中,我们通过引入一个跨表预训练 Transformer——XTFormer,来填补这一空白,用于通用的下游表格预测任务。我们的方法论见解是预训练 XTFormer 以建立一个包含所有潜在特征-目标映射的“元函数”空间。在预训练中,从预训练表格数据集中提取各种潜在映射,并将其嵌入到“元函数”空间中,然后通过指定的坐标定位方法从“元函数”空间中为下游任务提取合适的映射。实验表明,在 190 个下游表格预测任务中,我们的跨表预训练 XTFormer 在 137 个(72%)任务上优于 XGBoost 和 Catboost,并在 144 个(76%)和 162 个(85%)任务上分别超过了代表性深度学习模型 FT-Transformer 和表格预训练方法 XTab。

关键词

引用

@article{arxiv.2406.00281,
  title  = {Cross-Table Pretraining towards a Universal Function Space for Heterogeneous Tabular Data},
  author = {Jintai Chen and Zhen Lin and Qiyuan Chen and Jimeng Sun},
  journal= {arXiv preprint arXiv:2406.00281},
  year   = {2024}
}