克服 Twitter 数据稀缺:使用推文作为引导及其在自闭症相关主题内容分析中的应用
社会与信息网络
2016-11-17 v1
摘要
尽管近期工作已证明使用 Twitter 消息进行特定内容的数据挖掘和分析的潜力,但此类分析的深度固有地受限于 140 字符推文限制所造成的数据稀缺。本文中,我们描述了一种用于定向知识探索的新方法,该方法使用推文内容分析作为初步步骤。此步骤用于引导从直接相关但内容更丰富的来源进行更复杂的数据收集。我们特别证明了通过跟踪推文中包含的 URL 可以收集有价值的信息。我们自动从相应网页中提取内容,并将每个网页视为链接到原始推文的文档,展示了如何基于层次狄利克雷过程的时序主题模型来跟踪 Twitter 社区复杂主题结构的演变。通过使用自闭症相关推文,我们证明了我们的方法能够捕捉到比用户选择的标签更有意义的信息交换图景。
引用
@article{arxiv.1507.02973,
title = {Overcoming data scarcity of Twitter: using tweets as bootstrap with application to autism-related topic content analysis},
author = {Adham Beykikhoshk and Ognjen Arandjelovic and Dinh Phung and Svetha Venkatesh},
journal= {arXiv preprint arXiv:1507.02973},
year = {2016}
}
备注
IEEE/ACM International Conference on Advances in Social Networks Analysis and Mining, 2015