中文

机器学习中的分布密度、尾部与离群点:度量与应用

机器学习 2019-10-30 v1 机器学习

摘要

我们开发了量化给定(训练或测试)样本在底层分布中作为离群点程度的技术。我们评估了五种方法,按样本被代表程度对数据集中的样本打分(针对“被代表”的不同合理定义),并将这些方法应用于四个常用数据集:MNIST、Fashion-MNIST、CIFAR-10 与 ImageNet。尽管是相互独立的方法,我们发现这五种方法高度相关,表明“被代表”这一概念可被量化。除其他用途外,我们发现这些方法可结合用于识别 (a) 原型样本(符合人类预期);(b) 被记忆的训练样本;以及 (c) 数据集中不常见的子模态。进一步,我们展示了如何利用我们的度量确定课程学习的改进排序,并影响对抗鲁棒性。我们发布了所研究训练集与测试集上的所有度量值。

关键词

引用

@article{arxiv.1910.13427,
  title  = {Distribution Density, Tails, and Outliers in Machine Learning: Metrics and Applications},
  author = {Nicholas Carlini and Úlfar Erlingsson and Nicolas Papernot},
  journal= {arXiv preprint arXiv:1910.13427},
  year   = {2019}
}