面向样本高效处理效应估计的高维特征选择
机器学习
2020-11-05 v1 机器学习
统计方法学
摘要
从观测数据估计因果处理效应是因果推断中的基本问题。为避免偏倚,效应估计量必须控制所有混杂因素。因此从业者通常尽可能多地收集协变量数据以提高包含相关混杂因素的机会。虽然这解决了偏倚问题,但由于维度增加,其副作用是显著增加了准确估计效应所需的数据样本数量。在这项工作中,我们考虑如下设定:在满足强可忽略性的一大堆协变量 中,存在一个未知稀疏子集 足以包含以实现零偏倚,即与 为 -等价。我们提出一个涉及各处理组结果的公共目标函数,带有非凸联合稀疏正则化,在 的线性结果模型及每个处理组的亚高斯协变量下,该函数以高概率保证恢复 。这改善了效应估计的样本复杂度,使其随稀疏子集 的基数和 缩放,而非随全集 的基数缩放。我们通过处理效应估计实验验证了我们的方法。
引用
@article{arxiv.2011.01979,
title = {High-Dimensional Feature Selection for Sample Efficient Treatment Effect Estimation},
author = {Kristjan Greenewald and Dmitriy Katz-Rogozhnikov and Karthik Shanmugam},
journal= {arXiv preprint arXiv:2011.01979},
year = {2020}
}