中文

t-SNE-CUDA:GPU 加速的 t-SNE 及其在现代数据上的应用

机器学习 2018-08-01 v1 性能 机器学习

摘要

现代数据集与模型因其固有的高维度和海量样本数而 notoriously 难以探索与分析。现有采用降维至二维或三维的可视化方法对这些数据集常低效和/或无效。本文介绍 t-SNE-CUDA,一种用于可视化数据集与模型的 t 分布对称邻域嵌入(t-SNE)的 GPU 加速实现。t-SNE-CUDA 在 CIFAR-10 与 MNIST 数据集上以 50-700 倍加速显著优于当前实现。这些加速首次实现了对整个 ImageNet 数据集上神经网络激活的可视化——此前这在计算上不可行。我们还通过可视化 GloVe 嵌入向量展示了 NLP 领域的可视化性能。从这些可视化中,我们可得出关于在这些嵌入空间中使用 L2 度量的有趣结论。t-SNE-CUDA 公开于 https://github.com/CannyLab/tsne-cuda

关键词

引用

@article{arxiv.1807.11824,
  title  = {t-SNE-CUDA: GPU-Accelerated t-SNE and its Applications to Modern Data},
  author = {David M. Chan and Roshan Rao and Forrest Huang and John F. Canny},
  journal= {arXiv preprint arXiv:1807.11824},
  year   = {2018}
}

备注

To appear in HPML 2018 High Performance Machine Learning Workshop (Accepted, 2018)