重温维度灾难:噪声高维数据中距离何时对真实值具有指示性?
机器学习
2022-03-08 v5 机器学习
摘要
数据点之间的距离在机器学习应用中被广泛使用。然而,当被噪声破坏时,这些距离——以及基于它们的模型——在高维中可能失去效用。确实,噪声的微小边际效应会迅速累积,使经验上最近和最远邻偏离真实值。在本文中,我们利用渐近概率表达式精确刻画噪声高维数据中的此类效应。此前有观点认为,当距离集中发生时,邻域查询变得无意义且不稳定,这意味着数据中最远与最近邻之间的相对区分度很差。然而,当我们把数据分解为旨在恢复的真实值分量和噪声分量时,我们得出结论:情况未必如此。更具体地,我们推导出在特定条件下,受噪声影响的经验邻域关系即使在距离集中发生时仍可能忠实于真实值。我们还包含了对我们结果的充分实证验证,以及有趣的实验,其中我们推导出的邻居变得随机与否的“相移”恰好等同于常见降维方法在从带密集噪声的高维数据中恢复低维重构时表现差或好的相移。
引用
@article{arxiv.2109.10569,
title = {The Curse Revisited: When are Distances Informative for the Ground Truth in Noisy High-Dimensional Data?},
author = {Robin Vandaele and Bo Kang and Tijl De Bie and Yvan Saeys},
journal= {arXiv preprint arXiv:2109.10569},
year = {2022}
}