基于置信度的预测性能估计器用于模型监控
机器学习
2025-02-13 v2 人工智能
摘要
在机器学习模型部署到生产环境后,需要监控其预测性能。理想情况下,这种监控可以通过将模型的预测与真实标签进行比较来实现。为此,必须在推断后很快获得真实标签。然而,许多用例中,真实标签只有在显著延迟后才可用,或最坏的情况下根本不可用。在这种情况下,直接监控模型的预测性能是不可能的。最近develop了一些用于估计模型预测性能的方法,这些方法在真实标签不可用时进行估计。许多方法利用模型置信度或其他不确定性估计,并与一种天真的基线方法进行实验比较,即平均置信度(Average Confidence, AC),该方法将给定预测集合的置信度得分平均值作为模型准确率的估计。然而,迄今为止,AC方法的理论属性尚未得到 proper的探索。本文试图填补这一空白,通过审查AC方法并表明在某些一般假设下,它是模型准确率的无偏且一致的估计器,具有许多理想的属性。我们还将这个基线估计器与一些更复杂的估计器进行比较,实验结果表明在许多情况下,AC方法能够战胜其他方法,尽管不同估计器的比较质量在具体情况下具有较大影响。
引用
@article{arxiv.2407.08649,
title = {Confidence-based Estimators for Predictive Performance in Model Monitoring},
author = {Juhani Kivimäki and Jakub Białek and Jukka K. Nurminen and Wojtek Kuberski},
journal= {arXiv preprint arXiv:2407.08649},
year = {2025}
}
备注
This version corresponds to the final published version in JAIR. The published article is available at [https://doi.org/10.1613/jair.1.16709]