IOCC:面向小样本短文本聚类的语义中心与聚类中心对齐方法
统计方法学
2025-08-11 v1 机器学习
机器学习
摘要
在聚类任务中,将特征空间结构化为清晰、分离良好的分布至关重要。然而,由于短文本表示的有限表达能力,传统方法难以识别真正捕捉每个类别底层语义的聚类中心,导致表示被优化到次优方向。为解决此问题,我们提出了IOCC,一种新颖的少样本对比学习方法,实现了聚类中心与语义中心的对齐。IOCC包含两个关键模块:交互增强最优传输(IEOT)和中心感知对比学习(CACL)。具体而言,IEOT将个体样本间的语义交互融入传统最优传输问题,并生成伪标签。基于这些伪标签,我们聚合高置信度样本以构建逼近语义中心的伪中心。接着,CACL将文本表示优化至其对应的伪中心。随着训练的进行,两个模块的协作逐渐缩小聚类中心与语义中心之间的差距。因此,模型将学习到高质量的分布,从而提升聚类性能。在八个基准数据集上的大量实验表明,IOCC优于先前方法,在具有挑战性的生物医学数据集上实现了高达7.34%的提升,并在聚类稳定性和效率方面表现出色。代码可在以下链接获取:https://anonymous.4open.science/r/IOCC-C438。
引用
@article{arxiv.2508.06126,
title = {IOCC: Aligning Semantic and Cluster Centers for Few-shot Short Text Clustering},
author = {Jixuan Yin and Zhihao Yao and Wenshuai Huo and Xinmiao Yu and Xiaocheng Feng and Bo Li},
journal= {arXiv preprint arXiv:2508.06126},
year = {2025}
}