中文

社交媒体挖掘工具包(SMMT)

信息检索 2020-07-16 v1 社会与信息网络

摘要

在生物医学界,利用社交媒体数据开展研究的热度急剧上升。仅 PubMed 上,自 2014 年以来就有近 2500 条涉及分析来自 Twitter 与 Reddit 的社交媒体数据的出版条目。然而,这些工作中的绝大多数并未共享其代码或数据以复现其研究。除极少数例外,少数共享者将获取数据、最佳格式化数据以及对所获取数据进行自动与手动标注的负担推给了研究者。为解决这一紧迫问题,我们引入了社交媒体挖掘工具包(SMMT),这是一套旨在封装获取、预处理、标注与标准化社交媒体数据等繁琐细节的工具。我们工具包的目的是让研究者专注于回答研究问题,而非使用社交媒体数据的技术环节。通过使用标准工具包,研究者将能以对工具包所有使用者都透明的、一致的方式获取、使用与发布数据,从而简化社交媒体领域的研究可复现性与可及性。

关键词

引用

@article{arxiv.2003.13894,
  title  = {Social Media Mining Toolkit (SMMT)},
  author = {Ramya Tekumalla and Juan M. Banda},
  journal= {arXiv preprint arXiv:2003.13894},
  year   = {2020}
}

备注

3 figures, 8 pages double spaced, Under review in Genomics & Informatics journal