中文

TabImpute:面向表格数据的通用零样本插补

机器学习 2026-02-18 v4

摘要

数据缺失是表格环境中的一个普遍问题。现有的解决方案从简单的平均法到复杂的生成对抗网络(GAN)不等,但由于每种方法在现实世界不同领域中的性能差异很大且超参数调优耗时,目前尚不存在通用的插补方法。这种性能差异在小数据集中尤为明显,因为模型在这些数据集中拥有的信息量最少。基于 TabPFN(一种最近用于监督学习的表格基础模型),我们提出了 TabImpute,这是一种预训练 Transformer,能够提供准确且快速的零样本插补,在推理时无需拟合或超参数调优。为了训练和评估 TabImpute,我们引入了 用于表格环境的逐元素特征化,与之前的 TabPFN 插补方法相比实现了 100 倍的加速; 一种合成训练数据生成管道,包含多种缺失模式,以提高在现实世界缺失数据问题上的准确性;以及 MissBench,一个包含 42 个 OpenML 表格和 13 种新缺失模式的综合基准。MissBench 涵盖了医学、金融和工程等领域,展示了 TabImpute 与众多现有插补方法相比的稳健性能。

关键词

引用

@article{arxiv.2510.02625,
  title  = {TabImpute: Universal Zero-Shot Imputation for Tabular Data},
  author = {Jacob Feitelberg and Dwaipayan Saha and Kyuseong Choi and Zaid Ahmad and Anish Agarwal and Raaz Dwivedi},
  journal= {arXiv preprint arXiv:2510.02625},
  year   = {2026}
}