随机特征模型:研究朴素插补成功的一种途径
统计理论
2024-02-07 v1 机器学习
统计理论
摘要
常数(朴素)插补在实践中仍被广泛使用,因为这是处理缺失数据的一种首选且易于使用的技术。然而,由于插补后的输入可能与真实的底层数据存在显著差异,人们可能预期这种简单方法会导致较大的预测偏差。然而,最近的研究表明,在数据假设为完全随机缺失(MCAR)的高维线性预测器背景下,这种偏差很低。本文通过确认偏差可忽略不计的直觉,并指出令人惊讶的是朴素插补在极低维情况下仍然相关,从而完善了线性预测器的图景。为此,我们考虑了一个独特的底层随机特征模型,该模型为研究预测性能提供了严格的框架,同时观测特征的维度是变化的。基于这些理论结果,我们建立了应用于零插补数据的随机梯度下降(SGD)预测器的有限样本界,这是一种特别适合大规模学习的策略。如果 MCAR 假设显得过强,我们表明在更复杂的缺失数据场景下也会出现类似的有利行为。
引用
@article{arxiv.2402.03839,
title = {Random features models: a way to study the success of naive imputation},
author = {Alexis Ayme and Claire Boyer and Aymeric Dieuleveut and Erwan Scornet},
journal= {arXiv preprint arXiv:2402.03839},
year = {2024}
}