TabINR:用于表格数据插值的隐式神经表示框架
机器学习
2025-10-02 v1 人工智能
摘要
表格数据是广泛应用的基础,但实际数据集常因收集错误、隐私限制或传感器故障而不完整。由于缺失值会降低下游模型的性能或阻碍其适用性,而简单的数据插值方法倾向于引入偏差或扭曲数据分布,因此需要能够提供高质量插值、跨数据集规模保持鲁棐性并实现快速推理的插值方法。因此,我们引入TabINR,一种基于自解码器的隐式神经表示(INR)框架,将表格建模为神经函数。基于近期通用INR的最新进展,我们引入可学习的行和特征嵌入,有效处理表格数据的离散结构,可从部分观察中推断,从而在不修改已训练模型的情况下实现实例自适应插值。我们在多样化的十二个真实数据集上进行评估,并测试了多种缺失机制,结果显示该框架在插值准确率上 consistently 优于经典方法(KNN、MICE、MissForest)和深度学习方法(GAIN、ReMasker),在高维数据集上获益最为显著。
引用
@article{arxiv.2510.01136,
title = {TabINR: An Implicit Neural Representation Framework for Tabular Data Imputation},
author = {Vincent Ochs and Florentin Bieder and Sidaty el Hadramy and Paul Friedrich and Stephanie Taha-Mehlitz and Anas Taha and Philippe C. Cattin},
journal= {arXiv preprint arXiv:2510.01136},
year = {2025}
}