中文

基于共现词网络的不平衡短文本数据集主题模型

计算与语言 2023-11-07 v1

摘要

我们提出了一种用于在不平衡短文本数据集中检测稀缺主题的简便解决方案。我们的方法名为 CWUTM(基于共现词网络的不平衡短文本数据集主题模型),通过减轻偶然词共现的影响,解决了稀疏且不平衡的短文本主题这一挑战。这使得我们的模型能够优先识别稀缺主题(低频主题)。与以往方法不同,CWUTM 利用共现词网络捕捉每个词的主题分布,并且我们通过重新定义节点活跃度的计算以及在一定程度上对稀缺主题和丰富主题的表达进行归一化,增强了对稀缺主题的识别敏感度。此外,CWUTM 采用类似于 LDA 的 Gibbs 采样,使其易于适配各种应用场景。我们在不平衡短文本数据集上的大量实验验证表明,CWUTM 在发现稀缺主题方面优于基线方法。根据实验结果,所提出的模型能够在社交平台上早期且准确地检测新兴主题或意外事件。

关键词

引用

@article{arxiv.2311.02566,
  title  = {Topic model based on co-occurrence word networks for unbalanced short text datasets},
  author = {Chengjie Ma and Junping Du and Meiyu Liang and Zeli Guan},
  journal= {arXiv preprint arXiv:2311.02566},
  year   = {2023}
}