基于价值顺序估计距离度量学习的范畴数据聚类
机器学习
2025-09-01 v5 人工智能
机器学习
摘要
聚类是一种流行的机器学习技术,可处理和分析数据集,以自动揭示样本分布模式。由于范畴数据天然缺乏类似于数值数据欧几里得距离空间的明确度量空间,范畴数据的分布通常未得到充分表现,因而在聚类中可能容易扭曲有价值的信息。因此,本文引入一种新颖的基于顺序距离度量学习的方法,用以直观地通过学习其最优顺序关系来表示范畴属性值,并在类似数值属性的线上对其距离进行量化。由于主观创建的定性范畴值涉及模糊性和不确定性,因此在聚类上下文中学习顺序距离度量。因此,发展出一种新的联合学习范式,交替进行聚类和顺序距离度量学习,具有低时间复杂度且保证收敛。由于聚类友好的顺序学习机制以及顺序距离和欧几里得距离的齐次序性质,所提出的方法在范畴数据和混合数据集上实现了优越的聚类准确率。更重要的是,所学到的顺序距离度量大大降低了理解和管理非直观范畴数据的难度。通过进行消融研究、显著性检验、案例研究等实验,验证了所提出方法的有效性。源代码可在 https://github.com/DAJ0612/OCL_Source_Code 获取。
引用
@article{arxiv.2411.15189,
title = {Categorical Data Clustering via Value Order Estimated Distance Metric Learning},
author = {Yiqun Zhang and Mingjie Zhao and Hong Jia and Yang Lu and Mengke Li and Yiu-ming Cheung},
journal= {arXiv preprint arXiv:2411.15189},
year = {2025}
}
备注
Accepted to SIGMOD 2026