中文

在Twitter上自动识别比较组用于妊娠结局的数字流行病学研究

计算与语言 2019-08-19 v1 社会与信息网络

摘要

尽管流产、死产、出生缺陷和早产等不良妊娠结局十分普遍,其成因在很大程度上仍属未知。我们旨在通过开发自然语言处理流程,自动识别Twitter上可用于选取比较组的用户,推进社交媒体在妊娠结局观察性研究中的使用。我们标注了2361条由已在Twitter上宣布怀孕的用户发布的推文,用于训练和评估有监督机器学习算法,以自动检测报告其妊娠已达足月且婴儿出生体重正常的女性。在对基于多数投票的集成分类器的推文级预测作进一步处理后,该流程取得了用户级F1分数0.933,精确率0.947,召回率0.920。我们的流程将被部署用于识别大规模比较组,以研究Twitter上的妊娠结局。

关键词

引用

@article{arxiv.1908.06015,
  title  = {Automatically Identifying Comparator Groups on Twitter for Digital Epidemiology of Pregnancy Outcomes},
  author = {Ari Z. Klein and Abeselom Gebreyesus and Graciela Gonzalez-Hernandez},
  journal= {arXiv preprint arXiv:1908.06015},
  year   = {2019}
}