中文

利用深度学习在 Twitter 数据上识别药物使用

社会与信息网络 2020-03-26 v1 计算与语言 机器学习

摘要

社交媒体的收集与检查已成为研究用户心理活动和行为倾向的有用机制。通过对收集的 Twitter 数据进行分析,开发了用于对药物相关推文进行分类的模型。使用与主题相关的关键词(如俚语和药物消费方式)生成了一组推文。然后对潜在候选进行预处理,得到包含 3,696,150 行数据的数据集。比较了多种方法的分类能力,包括支持向量机(SVM)、XGBoost 和基于卷积神经网络(CNN)的分类器。不同于简单的特征或属性分析,我们采用了深度学习方法以筛选和分析推文的语义含义。与其他方法相比,两个基于 CNN 的分类器表现最佳。第一个使用 2,661 个手动标注样本训练,另一个包含合成生成的推文,总计 12,142 个样本。准确率分别为 76.35% 和 82.31%,AUC 为 0.90 和 0.91。此外,关联规则挖掘显示,常被提及的药物与经常使用的非法物质具有一定对应关系,证明了该系统的实际效用。最后,合成生成集提升了分数,改善了分类能力并证明了该方法论的价值。

关键词

引用

@article{arxiv.2003.11522,
  title  = {Utilizing Deep Learning to Identify Drug Use on Twitter Data},
  author = {Joseph Tassone and Peizhi Yan and Mackenzie Simpson and Chetan Mendhe and Vijay Mago and Salimur Choudhury},
  journal= {arXiv preprint arXiv:2003.11522},
  year   = {2020}
}

备注

20 pages, 12 figures, 8 tables