高维半监督学习:寻找均值推断的最优解
统计方法学
2026-05-12 v2 机器学习
摘要
半监督学习的一个基本挑战在于观测数据规模与带有缺失结果的数据收集规模不成比例。一种隐含的认识是,规模显著更大的带缺失结果数据集应当改善估计与推断。然而,这在多大程度上正确尚不清楚。我们阐明一个明确益处:可以对结果的均值进行 root-n 推断,同时仅要求对结果的一致估计,其速率可能慢于 root n。这通过一种新颖的 k-fold、交叉拟合、双重稳健估计量实现。我们讨论了线性与非线性结果。此类估计量特别适用于天然不具备 root-n 一致性的模型,如高维、非参数或半参数模型。我们将方法应用于异质处理效应的估计。
引用
@article{arxiv.1902.00772,
title = {High-dimensional semi-supervised learning: in search for optimal inference of the mean},
author = {Yuqian Zhang and Jelena Bradic},
journal= {arXiv preprint arXiv:1902.00772},
year = {2026}
}