基于注意力增强对比学习的短文本聚类判别表示学习
机器学习
2026-03-16 v3
摘要
对比学习在短文本聚类中已引起广泛关注,但其固有缺陷是误将来自同一类别的样本识别为负样本,然后在特征空间中将其分离(误判为负的分离),这会阻碍生成更优的表示。为生成更具判别性的表示以提高聚类效率,我们提出一种新颖的短文本聚类方法,称为基于注意力增强对比学习的判别表示学习用于短文本聚类(AECL)。AECL由两个模块组成,分别是伪标签生成模块和对比学习模块。两个模块都构建了样本级别的注意力机制,以捕获样本之间的相似性关系并聚合跨样本特征以生成一致的表示。其中,前者使用更具判别性的一致表示来产生可靠的监督信息以辅助聚类,而后者则探索相似性关系和一致表示,以优化正样本的构建,进行基于相似性的对比学习,有效解决误判为负的分离问题。实验结果表明,所提出的AECL超越了最先进的方法。若本文被接受,我们将开源代码。
引用
@article{arxiv.2501.03584,
title = {Discriminative Representation learning via Attention-Enhanced Contrastive Learning for Short Text Clustering},
author = {Zhihao Yao},
journal= {arXiv preprint arXiv:2501.03584},
year = {2026}
}
备注
arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission