中文

没有免费午餐:预测驱动推断的非渐近分析

机器学习 2025-05-27 v1 机器学习

摘要

预测驱动推断 (PPI) 是一种结合金标准标签与可能含噪的伪标签以进行统计估计的流行策略。先前工作表明了 PPI++(PPI 的一种自适应形式)的渐近“免费午餐”,表明 PPI++ 的*渐近*方差始终小于或等于仅使用金标准标签所得方差。值得注意的是,该结果*无论伪标签质量如何*均成立。在本工作中,我们通过对 PPI++ 在均值估计问题上的估计误差进行精确有限样本分析,揭示了这一结果。我们给出了一个“没有免费午餐”的结果,刻画了 PPI++ 估计误差在何种设定(及样本量)下可证明劣于仅使用金标准标签。具体而言,当且仅当伪标签与金标准之间的相关性高于一个取决于标注样本数 (nn) 的特定水平时,PPI++ 才会表现更优。在某些情况下,我们的结果可大幅简化:对于 Gaussian 数据,相关性必须至少为 1/n21/\sqrt{n - 2} 才能观察到改进,对于二元标签也有类似结果。在实验中,我们展示了理论发现在真实数据集上成立,并给出了 PPI++ 单样本与样本拆分变体之间权衡的见解。

关键词

引用

@article{arxiv.2505.20178,
  title  = {No Free Lunch: Non-Asymptotic Analysis of Prediction-Powered Inference},
  author = {Pranav Mani and Peng Xu and Zachary C. Lipton and Michael Oberst},
  journal= {arXiv preprint arXiv:2505.20178},
  year   = {2025}
}