中文

一种确定模糊c均值聚类验证参数的简单快速方法

定量方法 2010-04-09 v1 基因组学

摘要

模糊c均值聚类广泛用于识别高维数据集中的聚类结构,例如在DNA微阵列和定量蛋白质组学实验中获得的数据集。其主要局限性之一是缺乏一种计算快速的方法来确定模糊化参数和聚类数这两个参数。错误的参数值可能导致结果中包含纯粹的随机波动,或者忽略潜在的重要数据。最优解对应的参数值应使得聚类对纯随机数据集不产生任何结果,但在随机性边缘能以最大分辨率检测到聚类结构的形成。通过对应用于随机数据集的聚类程序结果进行评估,实现了最优参数值的估计。在这种情况下,模糊化参数的最优值遵循仅取决于数据集主要属性的通用规则。将集合的维度和对象数量作为输入值,而非评估整个数据集,使我们能够提出一个直接确定其值的函数关系。这一结果强烈反对像以往许多研究那样将模糊化参数设定为2。验证指标通常用于估计最优聚类数。比较表明,质心间的最小距离所提供的结果至少等同于或优于其他计算成本更高的指标所获得的结果。

关键词

引用

@article{arxiv.1004.1307,
  title  = {A simple and fast method to determine the parameters for fuzzy c-means cluster validation},
  author = {Veit Schwämmle and Ole N. Jensen},
  journal= {arXiv preprint arXiv:1004.1307},
  year   = {2010}
}

备注

9 pages, 9 figures