中文

bigMap:基于并行化 t-SNE 的大数据映射

机器学习 2019-11-05 v2 定量方法

摘要

我们引入一种特别适用于大规模结构化数据的改进无监督聚类协议。该协议遵循三步:数据的降维、数据低维表示上的密度估计,以及密度景观的最终分割。对于降维步骤,我们引入著名的 t-随机邻近嵌入(t-SNE)算法的并行化实现,显著缓解了某些固有局限,同时提升其对大型数据集的适用性。我们还引入一种新的自适应核密度估计,特别与 t-SNE 框架耦合,以从嵌入数据中获取准确的密度估计,以及一种降雨分水岭算法的变体来识别密度景观中的簇。整个映射协议封装于 bigMap R 包中,连同可视化与分析工具,以简化聚类的定性与定量评估。

关键词

引用

@article{arxiv.1812.09869,
  title  = {bigMap: Big Data Mapping with Parallelized t-SNE},
  author = {Joan Garriga and Frederic Bartumeus},
  journal= {arXiv preprint arXiv:1812.09869},
  year   = {2019}
}

备注

24 pages main text including 6 (full-page) figures; bigMap R-pacakge available at CRAN