通过 k 近邻检测数据集漂移与非独立同分布采样
机器学习
2023-05-26 v1
摘要
我们提出一种简单的统计检验,用于检测数据独立同分布(IID)假设被违背的某些情形。所考虑的具体违背形式在真实应用中十分常见:数据集中的样本是否按顺序排列,使得几乎相邻的样本往往具有更相似的特征值(例如由于分布漂移或数据点间的吸引交互)。基于 k 近邻估计,我们的方法可用于审计任意多元数值数据以及其他可数值化表示(或许借助模型嵌入)的数据类型(图像、文本、音频等)。与现有检测漂移或自相关的方法相比,我们的方法既适用于更多数据类型,也能在实践中检测更广泛的 IID 违背。代码:https://github.com/cleanlab/cleanlab
引用
@article{arxiv.2305.15696,
title = {Detecting Dataset Drift and Non-IID Sampling via k-Nearest Neighbors},
author = {Jesse Cummings and Elías Snorrason and Jonas Mueller},
journal= {arXiv preprint arXiv:2305.15696},
year = {2023}
}