机器学习中的分布密度、尾部与离群点:度量与应用
机器学习
2019-10-30 v1 机器学习
摘要
我们开发了量化给定(训练或测试)样本在底层分布中作为离群点程度的技术。我们评估了五种方法,按样本被代表程度对数据集中的样本打分(针对“被代表”的不同合理定义),并将这些方法应用于四个常用数据集:MNIST、Fashion-MNIST、CIFAR-10 与 ImageNet。尽管是相互独立的方法,我们发现这五种方法高度相关,表明“被代表”这一概念可被量化。除其他用途外,我们发现这些方法可结合用于识别 (a) 原型样本(符合人类预期);(b) 被记忆的训练样本;以及 (c) 数据集中不常见的子模态。进一步,我们展示了如何利用我们的度量确定课程学习的改进排序,并影响对抗鲁棒性。我们发布了所研究训练集与测试集上的所有度量值。
引用
@article{arxiv.1910.13427,
title = {Distribution Density, Tails, and Outliers in Machine Learning: Metrics and Applications},
author = {Nicholas Carlini and Úlfar Erlingsson and Nicolas Papernot},
journal= {arXiv preprint arXiv:1910.13427},
year = {2019}
}