中文

利用 Fisher 可分性分析估计大型生物数据集的有效维度

机器学习 2019-01-21 v1 定量方法 机器学习

摘要

现代大规模数据集通常被称为高维数据集。然而,它们的数据点云通常具有结构,由于存在簇、点靠近低维流形或细粒度聚集,显著降低了其内在维度(ID)。我们在几个基准测试和真实生物数据集上测试了一种最近引入的维度估计器,该估计器基于分析数据点的可分性属性。我们表明,所引入的 ID 度量具有与 state-of-the-art 度量相当的竞争力,在很宽的维度范围内均有效,并且在有噪声样本的情况下表现更好。此外,它允许在内在流形假设不成立的情况下估计内在维度。

关键词

引用

@article{arxiv.1901.06328,
  title  = {Estimating the effective dimension of large biological datasets using Fisher separability analysis},
  author = {Luca Albergante and Jonathan Bac and Andrei Zinovyev},
  journal= {arXiv preprint arXiv:1901.06328},
  year   = {2019}
}

备注

8 pages, submitted to IJCNN-2019