中文

面向异构属性数据聚类的统一距离度量学习

机器学习 2026-03-06 v1 人工智能

摘要

由数值型和类别型属性组成的数据集(本文称为混合数据)在实际聚类任务中十分常见。与表明两种概念之间倾向关系(如高温与低温)的数值属性,其值在明确定义的欧几里得距离空间中;而类别型属性值则是不同概念(如不同职业)嵌入隐式空间的不同概念。同时利用这两种截然不同类型的信息是不可避免且具有挑战性的难题,大多数先进方法要么将异构的数值和类别属性编码为同一类型,要么为其定义统一度量以进行混合数据聚类,却未揭示其内在关联。因此,本文研究各种属性之间的关联性,并提出一种 novel 的异构属性重构与表示学习(Heterogeneous Attribute Reconstruction and Representation, HARR)范式以进行聚类分析。该范式将异构属性转化为均匀状态以进行距离度量学习,并将学习与聚类集成,以自动适应不同聚类任务。与大多数现有方法直接采用既定距离度量或学习属性权重以在子空间中搜索聚类不同,本文提出将每个属性的值投影到统一可学习的多个空间,以更精细地表示和学习类别数据的数据距离度量。HARR 无需额外参数、保证收敛,可更有效地自适应目标聚类数 k。大量实验表明其在准确性和效率方面均优于现有方法。

关键词

引用

@article{arxiv.2603.04458,
  title  = {Learning Unified Distance Metric for Heterogeneous Attribute Data Clustering},
  author = {Yiqun Zhang and Mingjie Zhao and Yizhou Chen and Yang Lu and Yiu-ming Cheung},
  journal= {arXiv preprint arXiv:2603.04458},
  year   = {2026}
}

备注

ESWA 2025 paper