中文

利用社交媒体属性增强关键词检测:应用于新浪微博的 IDF-LDA 模型

计算与语言 2023-07-04 v1 信息检索 社会与信息网络

摘要

随着 Twitter、微博等社交媒体的快速发展,从海量文本数据流中实时检测关键词已成为关键问题。关键词检测问题旨在从大规模文本数据中搜寻重要信息以反映最重要事件或话题。然而,社交媒体数据通常具独特特征:文档短小、语言口语化、数据具显著时间模式。因此,从这些文本流中发现关键信息颇具挑战。本文提出一种新方法解决社交媒体关键词检测问题。我们的模型结合逆文档频率(IDF)与潜在狄利克雷分配(LDA)模型,以更好应对社交媒体数据如点赞数、评论数与转发数等独特属性。基于这些属性对每篇文档重要性加权,我们的方法可随时间有效检测更具代表性的关键词。在微博数据上多条件下开展的全面实验表明,我们的方法在多种评估指标上优于基线,包括多问题设定下的精确率与召回率。

关键词

引用

@article{arxiv.2306.07978,
  title  = {Utilizing Social Media Attributes for Enhanced Keyword Detection: An IDF-LDA Model Applied to Sina Weibo},
  author = {Yifei Yue},
  journal= {arXiv preprint arXiv:2306.07978},
  year   = {2023}
}

备注

4 pages, 1 figure and 5 tables