基于 LDA 模型的主题词分析
社会与信息网络
2014-05-16 v1 分布式、并行与集群计算
信息检索
机器学习
机器学习
摘要
社交网络分析(SNA)是一个描述和建模特定人群社会联系的研究领域,在网络服务中颇受欢迎。我们的主题词分析项目是一种 SNA 方法,旨在可视化从 Obama.com 发送至注册于俄亥俄州哥伦布市账户的电子邮件中的主题词。基于 SNA 中流行的主题模型——潜在狄利克雷分配(LDA)模型,我们的项目刻画了发送者对目标接收群体的偏好。我们使用 Gibbs 采样来估计主题和词分布。我们的训练和测试数据来自无碳服务器 Datagreening.com 的电子邮件。我们使用并行计算工具 BashReduce 进行词处理,并生成每个潜在主题下的相关词,以发现专门发送给当地哥伦布接收者的政治新闻的典型信息。在使用并行工具 BashReduce 的两个实例上运行,与在本地单个实例上处理内容相比,我们的项目在处理原始内容时提速近 30%。此外,实验结果表明,在选择了适当大小的主题词列表的条件下,应用于我们项目的 LDA 模型在查找目标词方面的准确率比 TF-IDF 模型高出 53.96%。
引用
@article{arxiv.1405.3726,
title = {Topic words analysis based on LDA model},
author = {Xi Qiu and Christopher Stewart},
journal= {arXiv preprint arXiv:1405.3726},
year = {2014}
}