TabH2O:用于表格预测的统一基础模型
机器学习
2026-05-19 v1
摘要
我们提出了 TabH2O,一种用于表格数据的基础模型,能够通过上下文学习在单次前向传播中完成分类与回归。TabH2O 基于 TabICL 架构并进行了若干关键修改:(1) 统一训练,单一模型通过双头架构同时处理分类与回归,无需单独的模型,从而降低了总预训练成本;(2) 单阶段预训练,通过训练稳定性改进(有界可伸缩 softmax、阶段间归一化、可学习残差缩放、logit 软截断)消除了对多阶段课程学习的需求,从而从一开始便可以使用全长序列进行训练;(3) 噪声感知预训练,合成数据集包含显式的噪声维度,以教导模型对无关特征的鲁棒性。我们在 TALENT 基准(300 个数据集)上评估了 TabH2O v1(29.2M 参数),在 6 种评估方法中取得了 2.55 的平均排名,优于经过调优的 CatBoost(4.07)、H2O AutoML(4.18)和 LightGBM(5.08),与 TabPFN v2.6(2.74)相当,仅次于 TabICL v2(2.12),并在涵盖分类与回归任务的 81% 测试数据集中位列前三名。
引用
@article{arxiv.2605.18383,
title = {TabH2O: A Unified Foundation Model for Tabular Prediction},
author = {Pascal Pfeiffer and Dmitry Gordeev and Mathias Müller and Laura Fink and Joan Salvà Soler and Mark Landry and Branden Murray and Marcos V. Conde and Sri Satish Ambati},
journal= {arXiv preprint arXiv:2605.18383},
year = {2026}
}
备注
Technical Report - https://tabh2o.h2oai.com/