均值回归:通过事后回归实现少标签自动评估与推断
机器学习
2025-07-09 v2 机器学习
摘要
能够有效执行任意任务的机器学习系统的可用性,使得来自这些系统的合成标签被用于统计推断的应用中,例如数据分析或模型评估。预测驱动推断(PPI)框架提供了一种方法,可同时利用大量伪标签数据池和少量具有真实、高质量标签的样本,以产生待评估量的低方差、无偏估计。关于PPI的大部分工作考虑了相对大量的标记样本集,而获取这些样本可能耗费大量资源。然而,我们发现当标记数据稀缺时,PPI++方法的表现甚至可能比经典推断更差。我们通过将PPI++与普通最小二乘回归联系起来分析了这一现象,后者在小样本量下同样会出现高方差,并利用该回归框架更好地理解了PPI的有效性。受此启发,我们提出了两种基于PPI的新技术,利用稳健回归器在少标签机制下产生方差更低的估计量。
引用
@article{arxiv.2411.12665,
title = {Regression for the Mean: Auto-Evaluation and Inference with Few Labels through Post-hoc Regression},
author = {Benjamin Eyre and David Madras},
journal= {arXiv preprint arXiv:2411.12665},
year = {2025}
}
备注
Presented as a conference paper at ICML 2025