从 $t$-SNE 到 UMAP:基于对比学习的视角
机器学习
2024-06-06 v2 人机交互
摘要
邻域嵌入方法 -SNE 和 UMAP 是可视化高维数据集的事实标准。尽管其出发点完全不同,它们的损失函数看似无关。在实践中,它们产生差异显著的嵌入,并可能对同一数据给出相互冲突的解释。-SNE 与 UMAP 之间产生此种差异的根本原因,以及更一般地二者之间的确切关系,一直不明确。本文通过对对比学习方法的新的认识,揭示了它们的概念联系。噪声对比估计可用于优化 -SNE,而 UMAP 依赖于另一种对比方法——负采样。我们找到了这两种对比方法之间的精确关系,并给出了负采样所引入失真的一种数学刻画。从视觉上看,该失真导致 UMAP 相比 -SNE 生成更紧凑、簇更紧密的嵌入。我们利用这一新的概念联系提出并实现了负采样的推广,使我们能够在 -SNE 与 UMAP 及其各自嵌入之间进行插值(甚至外推)。沿该嵌入谱移动会导致离散/局部与连续/全局结构之间的权衡,从而降低过度解读任一单一嵌入中表面特征的风险。我们提供了 PyTorch 实现。
引用
@article{arxiv.2206.01816,
title = {From $t$-SNE to UMAP with contrastive learning},
author = {Sebastian Damrich and Jan Niklas Böhm and Fred A. Hamprecht and Dmitry Kobak},
journal= {arXiv preprint arXiv:2206.01816},
year = {2024}
}
备注
ICLR 2023. 44 pages, 19 figures. Code at https://github.com/hci-unihd/cl-tsne-umap and https://github.com/berenslab/contrastive-ne