行列式共识聚类
机器学习
2021-02-09 v1 机器学习
摘要
给定算法的随机重启会产生多个划分以得到共识聚类。诸如共识聚类之类的集成方法已被认为是比单一聚类算法更稳健的数据聚类方法。我们提出利用行列式点过程(DPP)对基于初始中心点点集的聚类算法(如 k-medoids 或 k-means)进行随机重启。DPP 与基于核的方法之间的关系使得 DPP 适于描述和量化对象间的相似性。DPP 偏好子集中中心点的多样性:因此,包含更相似点的子集比包含差异显著点的子集被生成的概率更低。当前最流行的采样技术是均匀随机采样中心点。我们通过大量仿真表明,与 DPP 相反,该技术既无法保证多样性,也不能良好覆盖数据的所有方面。DPP 的这两项特性是其能以小规模集成取得良好性能的关键。人工数据集上的仿真与真实数据集上的应用均表明,行列式共识聚类优于基于中心点均匀随机采样的经典算法(如 k-medoids 与 k-means 共识聚类)。
引用
@article{arxiv.2102.03948,
title = {Determinantal consensus clustering},
author = {Serge Vicente and Alejandro Murua},
journal= {arXiv preprint arXiv:2102.03948},
year = {2021}
}