GPGPU 线性复杂度 t-SNE 优化
机器学习
2019-08-12 v2 人工智能
机器学习
摘要
t 分布随机邻域嵌入(tSNE)算法近年来已成为高维数据探索性数据分析中最常用且最具洞察力的技术之一。tSNE 在不同尺度上揭示高维数据点的簇,同时仅需对其参数进行极小调参。尽管有这些优势,该算法的计算复杂度限制了其在相对较小的数据集上的应用。为解决此问题,近年来已开发出 tSNE 的若干演进版本,主要聚焦于数据点间相似性计算的可扩展性。然而,当可视化大型数据集的 tSNE 嵌入演化时,这些贡献不足以达到交互速率。本工作中,我们提出一种新颖的 tSNE 目标函数最小化方法,其重度依赖现代图形硬件并具有线性计算复杂度。我们的技术不仅超越了当前最优(state of the art),甚至可在浏览器中于客户端执行。我们提出使用自适应分辨率纹理来近似数据点间的排斥力,这些纹理在每次迭代中用 WebGL 绘制。该近似使我们能将 tSNE 最小化问题重新表述为一系列由 TensorFlow.js(一个用于可扩展张量计算的 JavaScript 库)计算的张量操作。
引用
@article{arxiv.1805.10817,
title = {GPGPU Linear Complexity t-SNE Optimization},
author = {Nicola Pezzotti and Julian Thijssen and Alexander Mordvintsev and Thomas Hollt and Baldur van Lew and Boudewijn P. F. Lelieveldt and Elmar Eisemann and Anna Vilanova},
journal= {arXiv preprint arXiv:1805.10817},
year = {2019}
}