朴素插补隐式正则化高维线性模型
统计理论
2023-02-01 v1 统计理论
摘要
处理缺失值进行预测存在两种不同方法:要么在拟合任何预测算法之前进行插补,要么使用能够原生纳入缺失值的专用方法。虽然插补被广泛(且容易)使用,但当随后应用低容量预测器(如线性模型)时,它不幸是有偏的。然而在实践中,朴素插补表现出良好的预测性能。本文中,我们研究了在高维线性模型且缺失数据满足MCAR条件下的插补影响。我们证明了零插补执行了一种与岭方法密切相关的隐式正则化,岭方法常用于高维问题。借助这一联系,我们确立插补偏差由岭偏差控制,并在高维下消失。作为预测器,我们主张对零插补数据采用平均SGD策略。我们建立了其泛化误差的上界,强调在d \sqrt n情形下插补是无害的。实验说明了我们的发现。
引用
@article{arxiv.2301.13585,
title = {Naive imputation implicitly regularizes high-dimensional linear models},
author = {Alexis Ayme and Claire Boyer and Aymeric Dieuleveut and Erwan Scornet},
journal= {arXiv preprint arXiv:2301.13585},
year = {2023}
}