中文

Khatri-Rao 聚类用于数据概要化

机器学习 2026-03-11 v2 机器学习

摘要

随着数据集规模和复杂度的不断增长,寻找简洁且准确的数据概要仍是关键挑战。质心聚类作为一种广泛采用的方法,能以少数原型表示数据集中的信息样本,每个原型代表数据中的一个簇。尽管广泛采用,但所得的数据概要常包含冗余,尤其是在由大量潜在簇构成的数据集中,这限制了其效果。为克服这一限制,我们提出 Khatri-Rao 聚类范式,将传统质心聚类扩展为通过假设质心来源于两个或多个简洁原型集合的相互作用,从而产生更为简洁但同样准确的数据概要。我们从 Khatri-Rao 范式的视角研究了两种核心聚类方法,即广为人知的 k-Means 算法和日益流行的深度聚类。为此,我们引入 Khatri-Rao k-Means 算法和 Khatri-Rao 深度聚类框架。大量实验表明,Khatri-Rao k-Means 在数据概要化的简洁性和准确性之间能够实现更有利的权衡。利用表示学习,Khatri-Rao 深度聚类框架能提供更大的好处,进一步缩小由深度聚类生成的数据概要大小,同时保持其准确性。

关键词

引用

@article{arxiv.2603.06602,
  title  = {Khatri-Rao Clustering for Data Summarization},
  author = {Martino Ciaperoni and Collin Leiber and Aristides Gionis and Heikki Mannila},
  journal= {arXiv preprint arXiv:2603.06602},
  year   = {2026}
}