中文

通过在VAE中学习干净子空间修复系统性离群值

机器学习 2022-07-19 v1 机器学习

摘要

数据清洗通常包括离群值检测和数据修复。系统性误差源于数据中反复出现的近乎确定性的变换,例如特定图像像素被设为默认值或水印。因此,容量足够的模型很容易对这些误差过拟合,使检测和修复变得困难。鉴于系统性离群值是干净实例的模式与系统性误差模式的组合,我们的核心见解是:与离群值相比,内点可以用模型中更小的表示(子空间)来建模。利用这一点,我们提出干净子空间变分自编码器(Clean Subspace Variational Autoencoder, CLSVAE),一种用于系统性误差检测和自动修复的新型半监督模型。主要思想是对潜空间进行划分,并分别建模内点和离群值模式。与先前相关模型相比,CLSVAE仅需极少标注数据即可生效,通常少于数据的2%。我们使用三个图像数据集,在不同腐蚀程度和标注集大小场景下进行了实验,并与相关基线比较。CLSVAE无需人工干预即可提供优越的修复效果,例如仅用0.25%的标注数据,相对于最接近基线我们就看到了58%的相对误差下降。

关键词

引用

@article{arxiv.2207.08050,
  title  = {Repairing Systematic Outliers by Learning Clean Subspaces in VAEs},
  author = {Simao Eduardo and Kai Xu and Alfredo Nazabal and Charles Sutton},
  journal= {arXiv preprint arXiv:2207.08050},
  year   = {2022}
}

备注

Submitted for review in ICLR 2022