中文

基于Transformer中增量特征分区的缺失值表格数据无插补学习

机器学习 2026-01-28 v5 机器学习

摘要

带有不同缺失值的表格数据集通过任意插补策略为机器学习准备。插补模型生成的合成值常常引发对数据质量和数据驱动结果可靠性的担忧。为了解决这些问题,本文提出了一种针对缺失值表格数据的无插补增量注意力学习方法(IFIAL)。推导出一对注意力掩码,并改装到Transformer中,以直接处理表格数据,无需插补或初始化缺失值。所提出的方法增量学习重叠且固定大小的特征集分区,以增强Transformer的性能。在17个不同表格数据集上的平均分类性能排名顺序突出了IFIAL相对于11种最先进学习方法(无论是否进行缺失值插补)的优越性。额外实验证实了IFIAL对不同类型和比例的缺失数据的鲁棒性,展示了其相对于依赖显式插补方法的优越性。特征分区大小等于原始特征空间的一半,在计算效率和预测性能之间取得了最佳权衡。IFIAL是首批使深度注意力模型能够直接从表格数据学习、无需插补缺失值的解决方案之一。源代码公开。

关键词

引用

@article{arxiv.2504.14610,
  title  = {Imputation-free Learning of Tabular Data with Missing Values using Incremental Feature Partitions in Transformer},
  author = {Manar D. Samad and Kazi Fuad B. Akhter and Shourav B. Rabbani and Ibna Kowsar},
  journal= {arXiv preprint arXiv:2504.14610},
  year   = {2026}
}