用于稀疏 Twitter 空间中药物滥用检测的集成深度学习模型
社会与信息网络
2019-04-04 v1
摘要
随着美国药物滥用问题加剧,许多主要利用社交媒体数据(如 Twitter 上的帖子)研究药物滥用相关活动的研究使用机器学习作为文本分类与过滤的有力工具。然而,鉴于 Twitter 用户话题广泛,在大多数数据集中与药物滥用相关的推文十分稀少。这种不平衡数据在构建有效推文分类器时仍是一个主要问题,在包含滥用相关俚语术语的研究中尤为明显。在本研究中,我们通过设计一个利用词级与字符级特征对滥用相关推文进行分类的集成深度学习模型来解决此问题。我们在 Twitter 数据集上报告了实验,其中可配置两类(滥用与非滥用)的百分比以模拟不同幅度的数据不平衡。结果表明,我们的集成深度学习模型优于传统机器学习模型的集成,尤其在高度不平衡的数据集上。
引用
@article{arxiv.1904.02062,
title = {An Ensemble Deep Learning Model for Drug Abuse Detection in Sparse Twitter-Sphere},
author = {Han Hu and NhatHai Phan and James Geller and Stephen Iezzi and Huy Vo and Dejing Dou and Soon Ae Chun},
journal= {arXiv preprint arXiv:1904.02062},
year = {2019}
}
备注
The 17th World Congress of Medical and Health Informatics [MedInfo 2019]