基于新型分诊与诊断方法在社交媒体上监测新冠肺炎
计算与语言
2022-01-10 v4
摘要
目的:本研究旨在开发一个端到端自然语言处理流水线,用于从患者撰写的社交媒体帖子中分诊和诊断 COVID-19,以便为研究人员和公共卫生从业者提供关于该疾病症状、严重程度和患病率的额外信息,而非在个体层面提供可操作的决策。材料与方法:该文本处理流水线首先使用条件随机场从患者帖子中提取 COVID-19 症状及相关概念,如严重程度、持续时间、否定和身体部位。随后在流水线的下一步中应用无监督基于规则的算法来建立概念之间的关系。提取的概念和关系随后被用于构建每篇帖子的两种不同向量表示。这些向量被分别应用于构建支持向量机学习模型,以将患者分诊为三类并诊断其是否患有 COVID-19。结果:我们报告,当模型在人工标注数据上训练时,COVID-19 分诊和诊断的宏平均和微平均 F1 分数分别在 71-96% 和 61-87% 范围内。我们的实验结果表明,当模型使用来自概念提取和基于规则分类器的预测标签进行训练时,可以获得类似的性能,从而产生端到端机器学习。此外,我们突出了诊断性机器学习模型揭示的重要特征,并将其与另一个 COVID-19 数据集中显示的最频繁症状进行比较。特别地,我们发现最重要的特征并不总是最频繁的特征。
引用
@article{arxiv.2103.11850,
title = {Monitoring Covid-19 on social media using a novel triage and diagnosis approach},
author = {Abul Hasan and Mark Levene and David Weston and Renate Fromson and Nicolas Koslover and Tamara Levene},
journal= {arXiv preprint arXiv:2103.11850},
year = {2022}
}
备注
13 pages, 6 figrues