TabRet:用于未见列预训练的基于 Transformer 的表格模型
机器学习
2023-04-18 v4 人工智能
摘要
我们提出 TabRet,一种可预训练的基于 Transformer 的表格数据模型。TabRet 被设计用于包含预训练阶段未见过列的下流任务。与其他方法不同,TabRet 在微调之前有一个称为重分词(retokenizing)的额外学习步骤,其基于掩码自编码损失来校准特征嵌入。在实验中,我们使用大量公共健康调查数据对 TabRet 进行预训练,并在医疗分类任务上对其进行微调,TabRet 在四个数据集上取得了最佳的 AUC 性能。此外,消融研究表明预训练期间的重分词和列的随机打乱增强有助于性能提升。代码可在 https://github.com/pfnet-research/tabret 获取。
引用
@article{arxiv.2303.15747,
title = {TabRet: Pre-training Transformer-based Tabular Models for Unseen Columns},
author = {Soma Onishi and Kenta Oono and Kohei Hayashi},
journal= {arXiv preprint arXiv:2303.15747},
year = {2023}
}
备注
Accepted at the Workshop on Understanding Foundation Models at ICLR 2023