基于最优邻域识别的尺度自适应鲁棒内在维数估计
机器学习
2026-04-02 v5 机器学习
统计理论
统计计算
统计方法学
统计理论
摘要
内在维数(ID)是无监督学习和特征选择中的关键概念,因其作为描述系统所必需变量数的下界。然而,在实际数据集中,ID往往取决于数据分析的尺度。在小尺度下,ID通常非常大,因为数据受到测量误差的影响。在大尺度下,ID也可能因数据所包含流形的曲率和拓扑结构而误判得很大。本文引入一种自动化协议,以选择 sweet spot,即ID在何种尺度范围内才具有意义且实用。该协议基于以下假设:在正确尺度下,数据密度应保持恒定。为了估计数据密度,需知道ID,因此该条件被施加于自一致的方式。我们通过人工和真实数据集的基准测试,展示了该方法在噪声下的有用性和鲁棒性。
引用
@article{arxiv.2405.15132,
title = {Scale-adaptive and robust intrinsic dimension estimation via optimal neighbourhood identification},
author = {Antonio Di Noia and Iuri Macocco and Aldo Glielmo and Alessandro Laio and Antonietta Mira},
journal= {arXiv preprint arXiv:2405.15132},
year = {2026}
}