中文

面向大规模稀疏文档数据的加速球形K-means聚类

机器学习 2024-11-19 v1 机器学习

摘要

本文提出了一种针对大规模高维稀疏文档数据集的加速球形K-means聚类算法。我们设计了一种以架构友好方式(AFM)工作的算法,这是一种抑制现代计算机系统CPU中性能下降因素(如指令数、分支预测错误和缓存未命中)的过程。为了实现AFM操作,我们利用了数据对象和聚类均值集的独特通用特征(UCs),即数据关系上的偏斜分布,如齐普夫定律和特征值集中现象。这些UCs表明,相似度计算中乘法次数的大部分是针对高文档频率(df)的词语执行的,而对象与均值特征向量之间相似度的大部分是通过少数高均值特征值的乘法获得的。我们提出的算法将倒排索引数据结构应用于均值集,通过新引入的两个结构参数在均值倒排索引中提取具有高df词语和高均值特征值的特定区域,并利用被划分为三部分的索引进行高效剪枝。该算法通过最小化与指令数相关的近似乘法次数来确定这两个结构参数,通过在所有对象间共享包含这两个参数的索引结构来减少分支预测错误,并通过将前述特定区域中频繁使用的数据保留在缓存中来抑制缓存未命中,从而实现以AFM方式工作。我们通过实验证明,与使用最先进技术的算法相比,我们的算法在大规模文档中高效地实现了卓越的速度性能。

关键词

引用

@article{arxiv.2411.11300,
  title  = {Accelerating spherical K-means clustering for large-scale sparse document data},
  author = {Kazuo Aoyama and Kazumi Saito},
  journal= {arXiv preprint arXiv:2411.11300},
  year   = {2024}
}

备注

28 pages, 23 figures