通过额外图节点实现分类数据与混合数据的谱聚类
机器学习
2024-03-12 v1 机器学习
摘要
将数据对象聚类为同质组是数据挖掘中最重要的任务之一。谱聚类可以说是最重要的聚类算法之一,因其理论可靠性而具有吸引力,并且适用于许多现实世界的数据设置。例如,混合数据(由数值特征和分类特征组成)通常通过数值离散化、虚拟编码或同时考虑两种数据类型的相似度计算来处理。本文探索了一种更自然的方式,将数值信息和分类信息纳入谱聚类算法,避免了数据预处理或使用复杂相似度函数的需求。我们提出添加对应于数据可能所属不同类别的额外节点,并表明这导出了一个可解释的聚类目标函数。此外,我们证明这一简单框架可为仅分类数据导出一个线性时间的谱聚类算法。最后,我们将我们算法的性能与其他相关方法进行了比较,表明其在性能和运行时间方面提供了具有竞争力的替代方案。
引用
@article{arxiv.2403.05669,
title = {Spectral Clustering of Categorical and Mixed-type Data via Extra Graph Nodes},
author = {Dylan Soemitro and Jeova Farias Sales Rocha Neto},
journal= {arXiv preprint arXiv:2403.05669},
year = {2024}
}