基于 Twitter 文本数据的主题建模与事件识别
社会与信息网络
2016-08-09 v1 计算与语言
摘要
互联网上社交媒体内容的迅猛增长激发了文本分析技术的发展,以理解和解决现实问题。利用统计主题建模有助于研究人员和实践者更好地理解文本内容,并为进一步分析提供有用信息。当我们处理大量动态文本(例如 Facebook 或 Twitter 数据集)时,统计主题建模变得尤为重要。在本研究中,我们总结了与肯尼亚具有挑战性的社会事件相关的四组 Twitter 消息数据集的消息内容。我们使用隐狄利克雷分配(LDA)主题建模来分析内容。我们的研究采用两种评估指标——归一化互信息(NMI)和主题一致性分析——来选取最佳的 LDA 模型。所获得的 LDA 结果表明,该工具可被有效地用于提取讨论主题并对其进行总结,以供后续人工分析。
引用
@article{arxiv.1608.02519,
title = {Topic Modelling and Event Identification from Twitter Textual Data},
author = {Marina Sokolova and Kanyi Huang and Stan Matwin and Joshua Ramisch and Vera Sazonova and Renee Black and Chris Orwa and Sidney Ochieng and Nanjira Sambuli},
journal= {arXiv preprint arXiv:1608.02519},
year = {2016}
}
备注
17 pages, 2 figures, 5 tables