邻域平均以提升离群点检测器性能
机器学习
2023-03-20 v1 计算机视觉与模式识别
数据结构与算法
摘要
我们假设相似对象应具有相似的离群分数。据我们所知,所有现有离群点检测器均独立计算每个对象的离群分数,而不考虑其他对象的离群分数。因此,它们无法保证相似对象具有相似的离群分数。为验证我们所提假设,我们提出一种用于离群点检测器的离群分数后处理技术,称为邻域平均(NA),其关注对象及其邻居,并保证它们获得比原始分数更相似的离群分数。给定任一离群点检测器给出的对象及其离群分数,NA通过将其与k个最近邻的分数相结合来修正其离群分数。我们使用著名的k近邻(k-NN)证明了NA的有效性。实验结果表明,在九个真实世界数据集上评估,NA平均将10个被测基线检测器的性能提升13%(AUC从0.70提升至0.79)。此外,即便已基于k-NN的离群点检测器也得到改进。实验还表明,在某些应用中,当检测器与NA联合使用时,检测器的选择不再显著,这可能对普遍认为数据模型是最重要因素的观点构成挑战。我们在 www.outlierNet.com 上公开代码以保证可复现性。
引用
@article{arxiv.2303.09972,
title = {Neighborhood Averaging for Improving Outlier Detectors},
author = {Jiawei Yang and Susanto Rahardja and Pasi Franti},
journal= {arXiv preprint arXiv:2303.09972},
year = {2023}
}