通过主题语义对比学习缓解短文本主题建模中的数据稀疏性
计算与语言
2022-11-24 v1
摘要
为克服短文本主题建模中的数据稀疏问题,现有方法通常依赖数据增强或短文本的数据特性来引入更多词共现信息。然而,它们大多未充分利用增强数据或数据特性:对数据中样本间关系学习不足,导致语义相似文本对的主题分布不相似。为更好地解决数据稀疏性,本文提出一种新颖的短文本主题建模框架——主题语义对比主题模型(TSCTM)。为充分建模样本间关系,我们采用一种基于主题语义的高效正、负采样新对比学习方法。该对比学习方法精炼表示、丰富学习信号,从而缓解稀疏问题。大量实验结果表明,无论是否有数据增强,我们的TSCTM均优于最先进基线,生成高质量主题与主题分布。
引用
@article{arxiv.2211.12878,
title = {Mitigating Data Sparsity for Short Text Topic Modeling by Topic-Semantic Contrastive Learning},
author = {Xiaobao Wu and Anh Tuan Luu and Xinshuai Dong},
journal= {arXiv preprint arXiv:2211.12878},
year = {2022}
}
备注
Accepted to EMNLP2022 main conference