基于共现词网络的短文本罕见主题发现模型
信息检索
2022-07-04 v1 机器学习
摘要
我们为不平衡短文本数据集中稀缺主题的发现有提供了一个简单而通用的解决方案,即基于共现词网络的模型CWIBTD,该模型能同时解决短文本主题的稀疏性与不平衡性,并减弱词语偶然成对出现的影响,使模型更专注于稀缺主题的发现。与以往方法不同,CWIBTD使用共现词网络对每个词的主题分布建模,通过改进节点活跃度计算方式并在一定程度上对稀缺主题与大型主题进行归一化,提高了数据空间的语义密度并确保其在识别罕见主题时的敏感性。此外,使用与LDA相同的Gibbs采样使得CWIBTD易于扩展到各种应用场景。在不平衡短文本数据集上的大量实验验证证实了CWIBTD在发现罕见主题方面优于基线方法。我们的模型可用于社交平台上新兴主题或意外事件的早期准确发现。
引用
@article{arxiv.2207.00432,
title = {A Rare Topic Discovery Model for Short Texts Based on Co-occurrence word Network},
author = {Chengjie Ma and Junping Du and Yingxia Shao and Ang Li and Zeli Guan},
journal= {arXiv preprint arXiv:2207.00432},
year = {2022}
}