面向短文本聚类的表示学习
计算与语言
2021-09-22 v1
摘要
由于短文本语料具有稀疏、高维和含噪的特性,有效的表示学习对短文本聚类至关重要。相较于传统的词袋(BoW)模型,现有预训练模型(如 Word2vec 和 BERT)以更紧凑、低维且连续的特征大幅提升了短文本表示的表达能力。然而,这些模型为通用目的而训练,因而对短文本聚类任务而言并非最优。本文提出两种方法,利用无监督自编码器(AE)框架,基于这些预训练文本模型进一步微调短文本表示,以获得最优聚类性能。在第一种方法结构文本网络图自编码器(STN-GAE)中,我们通过构建文本网络来利用语料中的结构文本信息,并采用图卷积网络作为编码器,将结构特征与预训练文本特征融合以进行文本表示学习。在第二种方法软簇分配自编码器(SCA-AE)中,我们在自编码器的潜空间上施加额外的软簇分配约束,以促使所学文本表示更具聚类友好性。我们在七个常用短文本数据集上测试了两种方法,实验结果表明,仅使用预训练模型进行短文本聚类时,BERT 表现优于 BoW 和 Word2vec;但只要我们进一步微调预训练表示,所提方法如 SCA-AE 便能大幅提升聚类性能,相较于单独使用 BERT 准确率提升可达 14%。
引用
@article{arxiv.2109.09894,
title = {Representation Learning for Short Text Clustering},
author = {Hui Yin and Xiangyu Song and Shuiqiao Yang and Guangyan Huang and Jianxin Li},
journal= {arXiv preprint arXiv:2109.09894},
year = {2021}
}
备注
To be published in 22nd International Conference on Web Information Systems Engineering (WISE2021)