基于层次最近邻下降(H-NND)的聚类
机器学习
2016-03-07 v3 计算机视觉与模式识别
机器学习
统计方法学
摘要
此前在 2014 年,我们提出了最近下降(Nearest Descent, ND)方法,能够生成一种称为内树(in-tree, IT)的高效图。由于某些优美且有效的特性,该 IT 结构被证明非常适合于数据聚类。尽管 IT 中存在一些冗余边,它们通常具有显著特征,因此不难将其移除。随后,为了防止看似冗余的边出现,我们通过在对 ND 添加“邻域(Neighborhood)”约束提出了最近邻下降(Nearest Neighbor Descent, NND)。因此,簇自动浮现,无需额外移除冗余边的要求。然而,NND 被证明仍不完美,因为它引入了一个新颖但更糟糕的问题,即“过度划分(over-partitioning)”问题。现在,在本文中,我们提出一种称为层次最近邻下降(Hierarchical Nearest Neighbor Descent, H-NND)的方法,它通过使用层次策略克服了 NND 的过度划分问题。具体而言,H-NND 利用 ND 有效地合并 NND 产生的过度分割子图或簇。与 ND 类似,H-NND 也生成 IT 结构,其中冗余边再次显现。这看似回到了 ND 所面临的情形。然而,与 ND 相比,H-NND 生成的 IT 结构中的冗余边通常变得更加显著,因此即使采用仅以边长为度量的最简单去边方法,也更容易且更可靠地识别。换言之,H-NND 构建的 IT 结构变得更适于数据聚类。我们在多个具有不同形状、维度和属性的聚类数据集上证明了这一点。此外,与 ND 相比,H-NND 通常为输入数据构建 IT 数据结构所花费的计算时间更少。
引用
@article{arxiv.1509.02805,
title = {Clustering by Hierarchical Nearest Neighbor Descent (H-NND)},
author = {Teng Qiu and Yongjie Li},
journal= {arXiv preprint arXiv:1509.02805},
year = {2016}
}
备注
19 pages, 9 figures