无标签下协变量偏移的模型性能估计
机器学习
2025-10-22 v5
摘要
部署后,机器学习模型常因数据分布偏移而出现性能下降。当标签缺失或延迟时,准确评估部署后性能具有挑战性。现有的代理方法(如数据漂移检测)无法充分衡量这些偏移的影响。为了解决这个问题,我们引入了一种新方法,用于评估未标记表格数据上的二分类模型,该方法能在协变量偏移下准确估计模型性能,我们称之为概率自适应性能估计(PAPE)。它可以应用于任何由混淆矩阵元素定义的性能指标。关键是,PAPE独立于原始模型运行,仅依赖其预测和概率估计,并且不需要对协变量偏移的性质做任何假设,而是直接从数据中学习。我们使用来自美国人口普查数据的900多个数据集-模型组合测试了PAPE,通过各种指标评估了其相对于几个基准的性能。我们的结果表明,PAPE优于其他方法,使其成为估计二分类模型性能的优越选择。
引用
@article{arxiv.2401.08348,
title = {Estimating Model Performance Under Covariate Shift Without Labels},
author = {Jakub Białek and Juhani Kivimäki and Wojtek Kuberski and Nikolaos Perrakis},
journal= {arXiv preprint arXiv:2401.08348},
year = {2025}
}
备注
25 content pages, 7 figures