中文

驾驭困惑度:t-SNE 嵌入中其与数据集大小的线性关系

机器学习 2024-12-06 v2 人工智能 定量方法 机器学习

摘要

用于分析高维数据的广泛使用流程利用二维可视化。这些可视化例如通过 t 分布随机邻域嵌入 (t-SNE) 创建。t-SNE 嵌入过程的一个关键要素是困惑度超参数。这是因为当困惑度改变时嵌入结构会发生变化。合适的困惑度选择依赖于数据集和嵌入的预期用途。因此,困惑度通常基于启发式方法、直觉和既往经验来选择。本文揭示了困惑度与数据集大小之间的线性关系。即,我们表明当困惑度相应调整时,嵌入在数据集样本间保持结构一致。定性和定量实验结果支持这些发现。这为可视化过程提供信息,在用户选择困惑度值时给予指导。最后,我们基于该线性关系概述了通过 t-SNE 进行高维数据可视化的若干应用。

关键词

引用

@article{arxiv.2308.15513,
  title  = {Navigating Perplexity: A linear relationship with the data set size in t-SNE embeddings},
  author = {Martin Skrodzki and Nicolas F. Chaves-de-Plaza and Thomas Höllt and Elmar Eisemann and Klaus Hildebrandt},
  journal= {arXiv preprint arXiv:2308.15513},
  year   = {2024}
}

备注

10 pages, 4 figures