中文

MaskTab:面向工业分类的、结合缩放定律与蒸馏的可扩展掩码表格预训练

机器学习 2026-05-13 v1 人工智能 计算与语言

摘要

表格数据是金融、医疗等高风险决策系统的基石。然而,工业级表格数据集存在固有难题:高维度、充满缺失条目,且很少进行大规模标注。尽管基础模型已经彻底改变了视觉和语言领域,表格学习仍然依赖于手工特征,缺乏通用的自监督框架。我们提出了MaskTab,一个专为工业级表格数据设计的统一预训练框架。MaskTab通过专用的可学习令牌对缺失值进行编码,使模型能够区分结构性缺失与随机丢弃。它联合优化了一种混合监督预训练方案——利用双路径架构来协调掩码重建与任务特定监督——以及一个MoE增强的损失函数,该函数自适应地将特征路由到专门的子网络中。在工业级基准测试上,经过严格的缩放测试,它比先前最优方法实现了+5.04%的AUC和+8.28%的KS提升。此外,其表示可以有效地蒸馏到轻量级模型中,在严格的延迟和可解释性约束下,实现了+2.55%的AUC和+4.85%的KS提升,同时提高了对分布偏移的鲁棒性。我们的工作表明,当尊重其结构特性时,表格数据可以接受基础模型的处理方式。

关键词

引用

@article{arxiv.2605.11408,
  title  = {MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification},
  author = {Bo Zheng and Yudong Chen and Zihua Xiong and Shuai Fang and Peidong He and Yang Yang and Sheng Guo},
  journal= {arXiv preprint arXiv:2605.11408},
  year   = {2026}
}