在协变量与标签同时偏移时估计并解释模型性能
机器学习
2022-09-20 v1 人工智能
机器学习
应用统计
摘要
部署的机器学习(ML)模型常遇到与其训练数据不同的新用户数据。因此,估计给定模型在新数据上的表现如何,是迈向可靠ML应用的重要一步。然而这极具挑战,因为数据分布可能以灵活方式改变,且我们可能没有任何新数据的标签,这在监控场景中屡见不鲜。本文中,我们提出一种新的分布偏移模型——稀疏联合偏移(Sparse Joint Shift, SJS),它同时考虑标签与少数特征的联合偏移。这统一并推广了若干现有偏移模型,包括标签偏移与稀疏协变量偏移,那些模型仅考虑特征或标签的边缘分布偏移。我们描述了SJS可识别的数学条件。我们进一步提出SEES,一种在SJS下刻画分布偏移并无标签估计模型在新数据上性能的算法框架。我们在多个真实数据集与各种ML模型上进行了广泛实验。在不同数据集与分布偏移下,SEES相较现有方法取得了显著的(高达一个数量级)偏移估计误差改进。
引用
@article{arxiv.2209.08436,
title = {Estimating and Explaining Model Performance When Both Covariates and Labels Shift},
author = {Lingjiao Chen and Matei Zaharia and James Zou},
journal= {arXiv preprint arXiv:2209.08436},
year = {2022}
}
备注
Accepted to NeurIPS 2022