中文

可信维度约简

统计方法学 2024-05-10 v1

摘要

不同的无监督维度约简模型,如PCA、LLE、Shannon的映射、tSNE、UMAP等,都基于不同的原理,因此很难在同一基准上进行比较。虽然它们通常对可视化 purposes 有帮助,但可能会产生原始数据中不存在的虚假模式,导致其可信度(或可信度)丧失。另一方面,某些响应变量(或类别标签)的信息允许我们进行监督维度约简,如SIR、SAVE等,这些方法旨在减少数据维度,而不会损害其解释特定 response 的能力。因此,缩减后的数据集不能用于进一步分析其与其他类型的 response 的关系,即它失去了通用性。为了在这两者之间取得更好的平衡,我们正式描述用于维度约简算法的数学模型,并提供两种指数来度量这些直观概念,如可信度和通用性。然后,我们提出一种局部脊骨化和维度约简(LSDR)算法,其大致在这两种指数上都实现了最优。与tSNE和UMAP等最新算法相比较,发现其在保持全局结构的同时,仍能保留有用的局部信息方面总体更好。我们还提出了LSDR的一些可能的扩展,可使该算法类似于tSNE和UMAP,适用于各种类型的数据。

关键词

引用

@article{arxiv.2405.05868,
  title  = {Trustworthy Dimensionality Reduction},
  author = {Subhrajyoty Roy},
  journal= {arXiv preprint arXiv:2405.05868},
  year   = {2024}
}

备注

This is a dissertation report presented for the completion of the degree of Master of Statistics (M. Stat.) of the author from Indian Statistical Institute