邻域嵌入中的吸引-排斥谱
机器学习
2024-06-06 v4 机器学习
摘要
邻域嵌入是一类利用 NN 图可视化复杂高维数据集的方法。为求得低维嵌入,这些算法将相邻点对间的吸引力与所有点间的排斥力相结合。此类算法中最流行的例子之一是 t-SNE。本文通过实验表明,使用夸张参数改变 t-SNE 中吸引力与排斥力的平衡会产生一系列嵌入,其特点是一个简单的权衡:更强的吸引力能更好地表示连续流形结构,而更强的排斥力能更好地表示离散簇结构并带来更高的 NN 召回率。我们发现 UMAP 嵌入对应于吸引力增强的 t-SNE;数学分析表明,这是因为 UMAP 采用的负采样优化策略强烈降低了有效排斥力。同样,常用于可视化发育单细胞转录组数据的 ForceAtlas2 产生的嵌入对应于吸引力进一步增强的 t-SNE。在此谱的极端处是 Laplacian Eigenmaps。我们的结果证明许多著名的邻域嵌入算法可被置于吸引-排斥谱上,并突出了它们之间的固有权衡。
引用
@article{arxiv.2007.08902,
title = {Attraction-Repulsion Spectrum in Neighbor Embeddings},
author = {Jan Niklas Böhm and Philipp Berens and Dmitry Kobak},
journal= {arXiv preprint arXiv:2007.08902},
year = {2024}
}