中文

均值回归:通过事后回归实现少标签自动评估与推断

机器学习 2025-07-09 v2 机器学习

摘要

能够有效执行任意任务的机器学习系统的可用性,使得来自这些系统的合成标签被用于统计推断的应用中,例如数据分析或模型评估。预测驱动推断(PPI)框架提供了一种方法,可同时利用大量伪标签数据池和少量具有真实、高质量标签的样本,以产生待评估量的低方差、无偏估计。关于PPI的大部分工作考虑了相对大量的标记样本集,而获取这些样本可能耗费大量资源。然而,我们发现当标记数据稀缺时,PPI++方法的表现甚至可能比经典推断更差。我们通过将PPI++与普通最小二乘回归联系起来分析了这一现象,后者在小样本量下同样会出现高方差,并利用该回归框架更好地理解了PPI的有效性。受此启发,我们提出了两种基于PPI的新技术,利用稳健回归器在少标签机制下产生方差更低的估计量。

关键词

引用

@article{arxiv.2411.12665,
  title  = {Regression for the Mean: Auto-Evaluation and Inference with Few Labels through Post-hoc Regression},
  author = {Benjamin Eyre and David Madras},
  journal= {arXiv preprint arXiv:2411.12665},
  year   = {2025}
}

备注

Presented as a conference paper at ICML 2025