面向基于随机距离离群检测的超高维数据表示学习
机器学习
2018-06-14 v1 人工智能
数据库
机器学习
摘要
学习超高维数据(例如具有数千/数百万特征的数据)的有表达力的低维表示,一直是使学习方法应对维数灾难的主要途径。然而,现有的无监督表示学习方法主要关注保留数据规律性信息,且独立于后续离群检测方法来学习表示,这可能导致检测不规则性(即离群点)的性能次优且不稳定。本文引入一种基于排序模型的框架,称为 RAMODO,以解决该问题。RAMODO 统一表示学习与离群检测,以学习专为最先进的离群检测方法——基于随机距离的方法——量身定制的低维表示。这种定制化学习为目标的离群检测器产生更优且更稳定的表示。此外,RAMODO 可利用少量标注数据作为先验知识来学习更具表达力且与任务相关的表示。我们将 RAMODO 实例化为一种高效方法 REPEN,以展示 RAMODO 的性能。在八个真实世界超高维数据集上的大量实验结果表明,REPEN(i)使基于随机距离的检测器获得显著更好的 AUC 性能和两个数量级的加速;(ii)比四种最先进的表示学习方法表现更好且更稳定;(iii)利用少于 1% 的标注数据实现高达 32% 的 AUC 提升。
引用
@article{arxiv.1806.04808,
title = {Learning Representations of Ultrahigh-dimensional Data for Random Distance-based Outlier Detection},
author = {Guansong Pang and Longbing Cao and Ling Chen and Huan Liu},
journal= {arXiv preprint arXiv:1806.04808},
year = {2018}
}
备注
10 pages, 4 figures, 3 tables. To appear in the proceedings of KDD18, Long presentation (oral)