ClustOfVar:用于变量聚类的 R 语言程序包
统计计算
2012-12-12 v1
摘要
变量聚类是一种将变量组织为同质簇的方法,即形成彼此高度相关、因而携带相同信息的变量组。此类方法可用于降维和变量选择。目前已发展出若干针对数值变量聚类的专门方法,但针对定性变量或定量与定性混合变量的方法则少得多。R 语言程序包 ClustOfVar 正是为此目的而开发。一个簇的同质性准则定义为各变量(定性变量用相关比,定量变量用平方相关系数)与一个综合定量变量的相关比或平方相关系数之和,该综合变量“尽可能好地”概括簇内变量。此综合变量是通过 PCAMIX 方法得到的第一主成分。本文提出两种变量聚类算法:迭代重定位算法和凝聚式层次聚类。我们还提出一种自助法(bootstrap)以确定合适的簇数。我们在小型数据集上演示了这些方法及相应的程序包。
引用
@article{arxiv.1112.0295,
title = {ClustOfVar: An R Package for the Clustering of Variables},
author = {M. Chavent and V. Kuentz and B. Liquet and L. Saracco},
journal= {arXiv preprint arXiv:1112.0295},
year = {2012}
}