论 UMAP 的真实损失函数
机器学习
2021-04-23 v2 机器学习
摘要
UMAP 已在许多学科中取代 t-SNE 成为可视化高维数据集的最先进方法,但其成功的原因尚不为人所充分理解。在这项工作中,我们详细研究了 UMAP 基于采样的优化方案。我们以封闭形式推导了 UMAP 的有效损失函数,发现它与已发表的损失函数不同。因此,我们表明 UMAP 并不旨在复现其理论驱动的高维 UMAP 相似度。相反,它试图复现仅编码共享的 最近邻图的相似度,从而挑战了先前对 UMAP 有效性的理解。相反,我们主张 UMAP 成功的关键在于其通过负采样隐式实现的吸引与排斥的平衡。这种平衡进而促进了通过梯度下降进行优化。我们在玩具数据和单细胞 RNA 测序数据上证实了我们的理论发现。
引用
@article{arxiv.2103.14608,
title = {On UMAP's true loss function},
author = {Sebastian Damrich and Fred A. Hamprecht},
journal= {arXiv preprint arXiv:2103.14608},
year = {2021}
}
备注
20 pages, 15 figures; minor changes, added run-times and error bars