用于聚类多元分类数据集类别的双向系统树图
统计方法学
2025-09-22 v1
摘要
本文研究多元分类数据集中类别的聚类问题,该问题可分解为合并同一变量的类别(即变量内类别)和组合不同变量的类别(即变量间类别)。对于变量内问题,目标是在不影响数据集基本特征的前提下减少类别数(从而降低数据维度),从而简化使用分类变量的任何分析的解释。类别可以是有序或名义性质的,该性质在聚类中得到尊重,即有序变量的仅相邻类别可以合并。对于变量间问题,目标是得到少量能够代表数据集中观测值的类别簇。在后一问题中,对哪些类别可以组合没有限制,只要它们不在同一变量内组合即可。在每个问题中,结果以一对上下堆叠的系统树图形式给出,称为双向系统树图。对于变量内问题,一旦每个变量内的所有类别合并完成,第二阶段是对变量本身进行聚类。对于变量间问题,第二阶段是对落入第一阶段聚类所得响应集的受访者群体进行聚类。该方法使用来自国际社会调查项目的社会学调查数据集进行说明。
引用
@article{arxiv.2509.15939,
title = {Bi-dendrograms for clustering the categories of a multivariate categorical data set},
author = {Michael Greenacre and Maurizio Vichi},
journal= {arXiv preprint arXiv:2509.15939},
year = {2025}
}
备注
15 pages, 5 figures, 3 tables