机器学习分类器中数据漂移的自动检测
机器学习
2021-11-11 v1
摘要
分类器及其他基于统计的机器学习(ML)技术基于训练数据的各种统计性质进行泛化或学习。统计ML获得理论或经验性能保证的潜在假设是:训练数据分布代表了生产数据分布。该假设常不成立;例如,数据的统计分布可能改变。我们将影响ML性能的变化称为“数据漂移”或“漂移”。许多分类技术计算其结果置信度度量。该度量可能不反映实际ML性能。一个著名例子是熊猫图片以约60%置信度被正确分类,但加入噪声后以高于99%置信度被错误分类为长臂猿。然而,我们此报告的工作表明,分类器的置信度度量可用于检测数据漂移。我们提出一种仅基于分类器给出的标签及其置信度的方法来预警可能导致数据漂移的数据分布或特征空间变化。我们的方法识别模型性能退化,且不需要生产中的数据标注(后者常缺失或延迟)。我们使用三个不同数据集与分类器的实验证明了该方法检测数据漂移的有效性。这尤其令人鼓舞,因为分类本身可能正确也可能不正确,且不需要模型输入数据。我们进一步探索了序贯变点检验的统计方法,以在控制误报率(一类错误)的同时自动确定识别漂移所需的数据量。
引用
@article{arxiv.2111.05672,
title = {Automatically detecting data drift in machine learning classifiers},
author = {Samuel Ackerman and Orna Raz and Marcel Zalmanovici and Aviad Zlotnick},
journal= {arXiv preprint arXiv:2111.05672},
year = {2021}
}