可证明的 t-SNE 聚类
机器学习
2017-06-09 v1 机器学习
摘要
t 分布随机邻域嵌入(t-SNE)是 van der Maaten 和 Hinton 于 2008 年提出的一种聚类与可视化方法,已迅速成为众多自然科学领域的标准工具。尽管取得了巨大成功,但其数学基础明显缺乏,算法的内部运作也未得到充分理解。本文旨在证明 t-SNE 能够恢复分离良好的聚类;更精确地说,我们证明了 t-SNE 在“早期夸大”阶段——van der Maaten & Hinton (2008) 和 van der Maaten (2014) 提出的一种优化技术——可以被严格分析。作为副产品,该证明提出了设置夸大参数 α 和步长 h 的新方法。数值例子说明了这些规则的有效性:特别是,拓扑结构(例如瑞士卷)的嵌入质量得到了改善。我们还讨论了与谱聚类方法的联系。
引用
@article{arxiv.1706.02582,
title = {Clustering with t-SNE, provably},
author = {George C. Linderman and Stefan Steinerberger},
journal= {arXiv preprint arXiv:1706.02582},
year = {2017}
}