基于密度导数比直接估计的模式寻找聚类与密度脊估计
机器学习
2018-04-03 v3
摘要
观测数据背后概率密度函数的模态与脊是有用的几何特征。模式寻找聚类通过将数据样本与最近模态相关联来分配簇标签,而密度脊的估计使我们能够发现数据中隐藏的低维结构。模式寻找聚类和密度脊估计中的一个关键技术挑战是准确估计密度的一阶和二阶导数与密度的比值。一种朴素方法采用三步法:首先估计数据密度,然后计算其导数,最后取它们的比值。然而,这种三步法可能不可靠,因为好的密度估计器未必意味着好的密度导数估计器,且除以估计密度可能会显著放大估计误差。为应对这些问题,我们提出了一种用于密度导数比的新估计器。该估计器不涉及密度估计,而是直接近似任意阶密度导数的比值。此外,我们建立了所提估计器的收敛速度。基于该估计器,我们开发了用于模式寻找聚类和密度脊估计的新方法,并建立了各自收敛到潜在密度的模态与脊的收敛速度。最后,我们通过实验证明所开发的方法显著优于现有方法,特别是对于相对高维的数据。
引用
@article{arxiv.1707.01711,
title = {Mode-Seeking Clustering and Density Ridge Estimation via Direct Estimation of Density-Derivative-Ratios},
author = {Hiroaki Sasaki and Takafumi Kanamori and Aapo Hyvärinen and Gang Niu and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1707.01711},
year = {2018}
}