标签损坏下的保形预测:不确定性插补与鲁棒重加权
机器学习
2026-02-27 v3
摘要
我们引入了一个框架,用于在带标签训练数据因噪声或缺失标签而损坏的情况下进行鲁棒的不确定性量化。我们基于保形预测(conformal prediction)构建方法,这是一种统计工具,用于生成以预先指定的概率覆盖测试标签的预测集。然而,保形预测的有效性建立在独立同分布(i.i.d.)假设之上,由于数据中存在损坏,该假设在我们的设定中并不成立。为了解决这种分布偏移,特权保形预测(PCP)方法提出利用特权信息(PI)——仅在训练期间可用的额外特征——来重加权数据分布,从而在权重准确的假设下产生有效的预测集。在这项工作中,我们分析了 PCP 对权重不准确性的鲁棒性。我们的分析表明,即使权重估计不佳,PCP 仍然可以产生有效的不确定性估计。此外,我们引入了不确定性插补(UI),这是一种不依赖于权重估计的新型保形方法。相反,我们以一种保留其不确定性的方式插补损坏的标签。我们的方法有理论保证支持,并在合成和真实基准上进行了实证验证。最后,我们证明这些技术可以集成到一个三重鲁棒框架中,只要至少有一个底层方法是有效的,就能确保统计上有效的预测。
引用
@article{arxiv.2505.04733,
title = {Conformal Prediction with Corrupted Labels: Uncertain Imputation and Robust Re-weighting},
author = {Shai Feldman and Stephen Bates and Yaniv Romano},
journal= {arXiv preprint arXiv:2505.04733},
year = {2026}
}