中文

面向混合类型表格数据的加权自解释聚类

机器学习 2026-04-08 v1

摘要

混合类型表格数据的聚类是探索性分析的基础,但由于数值-类别表示未对齐、特征相关性不均匀且依赖于上下文,以及聚类过程与解释之间脱节,仍具有挑战性。我们提出 WISE(加权自解释框架),在完全无监督且透明的流水线中统一表示、特征加权、聚类和解释。WISE 引入带填充的二值编码(BEP)以在统一的稀疏空间中对齐异构特征,逐特征剔除(LOFO)策略以感知多种高质量且多样化的特征加权视图,以及两阶段加权感知聚类程序以聚合替代语义分区。为确保内在可解释性,我们进一步开发了判别性频项(DFI),其产生从实例到聚类保持一致的特征级解释,并具有加法分解保证。在六个真实数据集上的广泛实验表明,WISE 在聚类质量方面持续优于经典和神经网络基线,同时保持高效,并产生基于驱动聚类相同原语的忠实、可人工理解的解释。

关键词

引用

@article{arxiv.2604.05857,
  title  = {Weight-Informed Self-Explaining Clustering for Mixed-Type Tabular Data},
  author = {Lehao Li and Qiang Huang and Yihao Ang and Bryan Kian Hsiang Low and Anthony K. H. Tung and Xiaokui Xiao},
  journal= {arXiv preprint arXiv:2604.05857},
  year   = {2026}
}