中文

用于高维聚类数据可视化的t-SNE算法的理论基础

机器学习 2022-11-02 v4 机器学习 统计理论 统计理论

摘要

本文研究了t分布随机邻域嵌入(t-SNE)算法的理论基础,该算法是一种流行的非线性降维与数据可视化方法。我们提出了一种基于梯度下降方法分析t-SNE的新理论框架。对于t-SNE的早期夸大阶段,我们展示了其基于底层图拉普拉斯算子的幂迭代的渐近等价性,刻画了其极限行为,并揭示了其与拉普拉斯谱聚类的深层联系,以及包括早期停止作为隐式正则化在内的基本原理。这些结果解释了该计算策略的内在机制与经验优势。对于t-SNE的嵌入阶段,我们刻画了低维映射在整个迭代过程中的运动学,并识别出一个放大阶段(以簇间排斥和低维映射的扩张行为为特征)以及一个稳定阶段。该一般理论解释了t-SNE在可视化聚类数据时快速收敛速率与卓越经验性能的原因,带来了对t-SNE可视化的解读,并为在各种应用中应用t-SNE及选择其调参提供了理论指导。

关键词

引用

@article{arxiv.2105.07536,
  title  = {Theoretical Foundations of t-SNE for Visualizing High-Dimensional Clustered Data},
  author = {T. Tony Cai and Rong Ma},
  journal= {arXiv preprint arXiv:2105.07536},
  year   = {2022}
}

备注

Accepted by Journal of Machine Learning Research