在 Twitter 上自动检测自我报告出生缺陷结局用于大规模流行病学研究
计算与语言
2019-10-03 v1
摘要
在近期工作中,我们识别并研究了一小群 Twitter 用户,其伴有出生缺陷结局的孕期可通过公开推文观察到。出生缺陷是婴儿死亡的首要原因,利用社交媒体的大规模潜力以补充研究出生缺陷的有限方法,依赖于自动方法的进一步发展。本研究的主要目标是朝扩大社交媒体用于观察伴有出生缺陷结局孕期的方向迈出第一步,即开发自动检测用户报告其出生缺陷结局推文的方法。我们标注并预处理了约 23,000 条提及出生缺陷的推文,以训练和评估有监督机器学习算法,包括特征工程与基于深度学习的分类器。我们还尝试了多种欠采样与过采样方法来处理类别不平衡。一个在原始不平衡数据集上训练的支撑向量机(SVM)分类器,使用 n-gram、词簇和结构特征,在正向类别上取得了最佳基线性能:“缺陷”类的 F1 值为 0.65,“可能缺陷”类为 0.51。我们的贡献包括(i)用于自动检测用户报告出生缺陷结局推文的自然语言处理(NLP)与有监督机器学习方法,(ii)对在不平衡、欠采样和过采样数据上训练的特征工程与深度学习分类器的比较,以及(iii)可利用我们公开语料库指导分类改进的错误分析。未来工作将聚焦于自动化用户级分析以实现队列纳入。
引用
@article{arxiv.1810.09506,
title = {Automatically Detecting Self-Reported Birth Defect Outcomes on Twitter for Large-scale Epidemiological Research},
author = {Ari Z. Klein and Abeed Sarker and Davy Weissenbacher and Graciela Gonzalez-Hernandez},
journal= {arXiv preprint arXiv:1810.09506},
year = {2019}
}