超越统计共现:解锁表格数据聚类的内在语义
人工智能
2026-04-14 v1
摘要
深度聚类(DC)已成为金融和医疗等现实领域中表格数据分析的强大工具。然而,大多数现有方法依赖于数据层面的统计共现来推断潜在度量空间,往往忽略了特征名称和值中蕴含的内在语义知识。因此,像“流感”和“感冒”这样语义相关的概念通常被当作符号标记处理,导致概念上相关的样本被孤立。为了弥合数据集特定统计信息与内在语义知识之间的鸿沟,本文提出了表格增强对比聚类(TagCC),这是一个将统计表格表示锚定到开放世界文本概念的新框架。具体来说,TagCC利用大型语言模型(LLM)通过语义感知转换将底层数据语义提炼为文本锚点。通过对比学习(CL),该框架利用这些锚点中封装的开放世界语义来丰富统计表格表示。此CL框架与聚类目标联合优化,确保学习到的表示既语义连贯又有利于聚类。在基准数据集上的大量实验表明,TagCC显著优于其同类方法。
引用
@article{arxiv.2604.10865,
title = {Beyond Statistical Co-occurrence: Unlocking Intrinsic Semantics for Tabular Data Clustering},
author = {Mingjie Zhao and Yunfan Zhang and Yiqun Zhang and Yiu-ming Cheung},
journal= {arXiv preprint arXiv:2604.10865},
year = {2026}
}