数据集内在维度的公理化方法
信息检索
2009-11-17 v1
摘要
我们对之前在 IJCNN'07 论文 (arXiv:cs/0703125) 中提出的数据集内在维度概念的公理化方法进行了更深入的分析。我们方法的主要特征是:数据集的高内在维度反映了维数灾难的存在(在某种数学精确意义上),并且低维流形的离散独立同分布样本的维度以高概率接近该流形的维度。同时,样本的内在维度容易受到中等高维噪声(幅度与流形尺寸相同)的破坏,并且遭受过高的计算复杂度(计算它是一个 -完全问题)。我们概述了一种克服这些困难的可能途径。
引用
@article{arxiv.0712.2063,
title = {An axiomatic approach to intrinsic dimension of a dataset},
author = {Vladimir Pestov},
journal= {arXiv preprint arXiv:0712.2063},
year = {2009}
}
备注
10 pages, 5 figures, latex 2e with Elsevier macros, final submission to Neural Networks with referees' comments taken into account