通过直接估计对数密度梯度进行模式寻找的聚类
机器学习
2014-04-22 v1
摘要
均值漂移聚类通过识别密度梯度的零点来寻找数据概率密度的模。由于不需要预先指定聚类数量,均值漂移已成为各种应用领域中流行的聚类算法。均值漂移的典型实现是先通过核密度估计估计密度,然后计算其梯度。然而,由于好的密度估计不一定意味着密度梯度的准确估计,这种间接的两步方法并不可靠。本文提出了一种无需经过密度估计而直接估计对数密度梯度的方法。该方法解析地给出全局解,因此计算效率高。然后我们开发了一个类似均值漂移的定点算法来寻找密度的模以进行聚类。与均值漂移一样,不需要预先设置聚类数量。实验表明,所提出的聚类方法比均值漂移效果好得多,尤其对于高维数据。实验结果进一步表明,所提出的方法优于现有的聚类方法。
引用
@article{arxiv.1404.5028,
title = {Clustering via Mode Seeking by Direct Estimation of the Gradient of a Log-Density},
author = {Hiroaki Sasaki and Aapo Hyvärinen and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1404.5028},
year = {2014}
}