通过大语言模型桥接分类数据聚类的语义鸿沟
机器学习
2026-05-29 v3 人工智能
计算与语言
摘要
定性数据广泛存在于医疗保健、营销和生物信息学等领域,其中聚类是模式发现的基本工具。定性数据聚类的核心难点在于度量携带无内在排序或距离的属性值之间的相似性。为恢复此类关系,现有研究通常依赖于数据集内的共现统计。然而,这种统计方法在样本量较小时变得不可靠,导致无法充分利用每个值语义上下文。针对这一限制,本文提出BREVE (Balanced Representation via External Value Enrichment),一个聚类框架,通过来自外部知识库的额外语义维度来丰富每个定性值。即,对每个唯一值进行扩展,添加一个编码其语义内容的稠密嵌入。为防止添加的维度稀释原始值身份,进一步附加一个轻量级 one-hot 组件。随后,一个自适应权重受聚类紧凑性指导,确定丰富维度进入最终表示的强度。通过该设计,实验在八个基准数据集上实现了平均 ARI 排名为 1.3,超过七个代表性竞争者。
引用
@article{arxiv.2601.01162,
title = {Bridging the Semantic Gap for Categorical Data Clustering via Large Language Models},
author = {Zihua Yang and Xin Liao and Yiqun Zhang and Yiu-ming Cheung},
journal= {arXiv preprint arXiv:2601.01162},
year = {2026}
}
备注
Accepted to ICPR2027