VillageNet:基于图的、易解释的、无监督聚类方法
机器学习
2026-02-24 v2 定量方法
机器学习
摘要
对大规模高维数据集进行聚类,数据集中包含多样化变量,对从这些数据集中提取高层次潜在信息至关重要。本文开发了一种无监督聚类算法,命名为 "Village-Net"。Village-Net 专为在无需预先知道聚类数量的前提下有效聚类高维数据而设计。该算法分为两个阶段:首先利用 K 均值聚类将数据集划分为若干互不相同的子集,我们称为 "村庄"。随后构建加权网络,其中每个节点代表一个村庄,捕捉它们之间的邻近关系。为实现最佳聚类,我们使用一种社区检测算法——Walk-likelihood Community Finder (WLCF),即我们团队成员开发的社区检测算法。Village-Net 聚类的一个显著特点是其能够自主确定数据内在特征所对应的最优聚类数量,以供后续分析。我们在具有已知真实标签的众多真实数据集上进行了广泛的基准测试,展示了其在归一化互信息 (NMI) 分数等指标上相较于其他最先进方法的竞争性表现。该算法计算效率高,时间复杂性为 O(N*k*d),其中 N 表示实例数量,k 表示村庄数量,d 表示数据集维数,因而非常适用于处理大规模数据集。
引用
@article{arxiv.2501.10471,
title = {VillageNet: Graph-based, Easily-interpretable, Unsupervised Clustering for Broad Biomedical Applications},
author = {Aditya Ballal and Gregory A. DePaul and Esha Datta and Asuka Hatano and Erik Carlsson and Ye Chen-Izu and Javier E. López and Leighton T. Izu},
journal= {arXiv preprint arXiv:2501.10471},
year = {2026}
}
备注
Software available at https://villagenet.streamlit.app/ Github Link: https://github.com/lordareicgnon/VillageNet