中文

基于层次聚类的高维数据快速近邻交互

机器学习 2017-09-13 v1

摘要

高维、不规则分布数据点间的近邻交互计算是许多基于图或核的机器学习算法与应用的基本任务。此类计算涉及大型稀疏交互矩阵,暴露了传统数据与计算重排序技术在改善现代计算机存储层次上空间与时间局部性方面的局限。我们引入一种获取矩阵置换的新方法,其产生理想的稀疏轮廓。该方法的指导原则在于获得具有稠密块的块稀疏轮廓。我们的轮廓模型与度量捕获了影响空间与时间局部性的本质属性,并允许稀疏轮廓变化而不强加固定模式限制。第二点区别在于通过探索和利用数据固有隐藏的多尺度聚类结构来高效获取理想轮廓的算法。该算法借助具有数据特定主特征轴的低维嵌入、层次数据聚类、多级矩阵压缩存储和多级交互计算等关键组件完成任务。我们提供来自两种重要数据分析算法案例研究的实验结果。所得性能与由相同稀疏度的规则带状矩阵支配的最佳情况交互的BLAS性能相当。

关键词

引用

@article{arxiv.1709.03671,
  title  = {Rapid Near-Neighbor Interaction of High-dimensional Data via Hierarchical Clustering},
  author = {Nikos Pitsianis and Dimitris Floros and Alexandros-Stavros Iliopoulos and Kostas Mylonakis and Nikos Sismanis and Xiaobai Sun},
  journal= {arXiv preprint arXiv:1709.03671},
  year   = {2017}
}