t-SNE 困惑度的自动选择
人工智能
2017-08-11 v1 机器学习
应用统计
机器学习
摘要
t-分布随机邻域嵌入(t-SNE)是数据可视化最常用的降维方法之一,但它有一个需要手动选择的困惑度超参数。在实践中,正确调整 t-SNE 困惑度要求用户理解该方法的内部机制并具备实践经验。我们提出了一种 t-SNE 困惑度的模型选择目标,其所需额外计算量相对于 t-SNE 本身可忽略不计。我们通过经验验证,我们的方法找到的困惑度设置与多个数据集上人类专家给出的偏好一致。我们还分析了我们的方法与贝叶斯信息准则(BIC)和最小描述长度(MDL)的相似性。
引用
@article{arxiv.1708.03229,
title = {Automatic Selection of t-SNE Perplexity},
author = {Yanshuai Cao and Luyu Wang},
journal= {arXiv preprint arXiv:1708.03229},
year = {2017}
}