为何不应使用零值填补?纠正训练神经网络中的稀疏性偏差
机器学习
2020-02-07 v5 机器学习
摘要
处理缺失数据是机器学习中最基本的问题之一。在众多方法中,最简单且最直观的方式是零值填补(zero imputation),即将缺失项的值简单地视为零。然而,许多研究已通过实验证实,零值填补在训练神经网络时会导致次优性能。但现有工作均未解释是什么导致了此类性能退化。本文引入变量稀疏性问题(VSP),该问题描述了一种现象:预测模型的输出随给定输入中缺失率的不同而大幅变化,并表明其会对模型性能产生对抗性影响。我们首先从理论上分析该现象,并提出一种简单而有效的处理缺失值的技术,称为稀疏性归一化(SN),其直接针对并解决 VSP。我们进一步在多个基准数据集上实验验证 SN,表明消除输入级稀疏性的偏差可提升性能并稳定神经网络的训练。
引用
@article{arxiv.1906.00150,
title = {Why Not to Use Zero Imputation? Correcting Sparsity Bias in Training Neural Networks},
author = {Joonyoung Yi and Juhyuk Lee and Kwang Joon Kim and Sung Ju Hwang and Eunho Yang},
journal= {arXiv preprint arXiv:1906.00150},
year = {2020}
}
备注
27 pages