关于 Heckman 选择模型中预测特征分配的研究
机器学习
2024-04-23 v2 统计方法学
摘要
在非随机缺失(MNAR)样本选择偏差下,预测模型的性能常会退化。本文关注 MNAR 样本选择偏差的一个经典实例:样本子集的结果非随机缺失。Heckman 选择模型及其变体常被用于处理此类样本选择偏差。Heckman 模型使用两个独立方程对样本的预测和选择建模,其中选择特征包含所有预测特征。使用 Heckman 模型时,必须从选择特征集中恰当选取预测特征。然而,为 Heckman 模型选取恰当的预测特征是一项艰巨任务,尤其在选择特征数量庞大时。现有使用 Heckman 模型的方法通常手动给定一组预测特征。本文中,我们提出 Heckman-FA,作为一种新颖的数据驱动框架,用于获取 Heckman 模型的预测特征。Heckman-FA 首先训练一个分配函数,判定某个选择特征是否被分配为预测特征。利用训练所得函数的参数,该框架基于给定所选预测特征下预测模型的拟合优度,以及预测与选择方程噪声项间的相关性,提取出合适的预测特征集。在真实数据集上的实验结果表明,Heckman-FA 在 MNAR 样本选择偏差下生成了鲁棒的回归模型。
引用
@article{arxiv.2309.08043,
title = {On Prediction Feature Assignment in the Heckman Selection Model},
author = {Huy Mai and Xintao Wu},
journal= {arXiv preprint arXiv:2309.08043},
year = {2024}
}
备注
Full version of work accepted to IJCNN 2024