基于 Automunge 的缺失数据填充
机器学习
2022-02-22 v1
摘要
缺失数据是数据科学实践中的根本障碍。本文综述了 Automunge 开源 python 库平台中可用于表格数据预处理的几种填充约定,包括“ML 填充(ML infill)”,即通过对训练集的分区提取为目标特征训练自动 ML 模型。我们进行了一系列验证实验,以针对下游模型性能对填充场景进行基准测试,发现在给定基准集上,许多情况下 ML 填充在数值型和类别型目标特征上均优于其他方案,否则至少处于其他填充方案的噪声分布之内。证据还表明,以带有指示填充存在的布尔整型标记的支持列对 ML 填充进行补充,通常有益于下游模型性能。我们认为这些结果足以推荐在表格学习中默认采用 ML 填充,并进一步推荐以指示填充存在的支持列对填充进行补充,二者均可通过 Automunge 库中的一键操作完成准备。我们的贡献包括一个在 python 生态中用于表格学习的自动 ML 派生的缺失数据填充库,其完全集成于带有广泛特征变换库的预处理平台,并带有一种新颖的面向生产的实现,该实现将填充模型基于指定的训练集,以对额外数据保持一致的基准。
引用
@article{arxiv.2202.09484,
title = {Missing Data Infill with Automunge},
author = {Nicholas J. Teague},
journal= {arXiv preprint arXiv:2202.09484},
year = {2022}
}
备注
14 pages, 9 figures