中文

UCE-FID:利用大规模无标注、中等规模众包标注与小规模专家标注推文进行食源性疾病检测

计算与语言 2023-12-05 v1

摘要

食源性疾病对公共卫生造成严重影响。利用社交媒体数据的深度学习监测应用旨在检测早期预警信号。然而,为模型训练标注与食源性疾病相关的推文需要大量人力资源,这使得在有限预算内收集足够数量的高质量推文标注极具挑战性。在海量社交媒体数据中,与食源性疾病相关的推文极其稀少,由此导致的严重类别不平衡进一步加剧了该问题。在类别不平衡数据集上训练的分类器会偏向多数类,从而难以实现准确检测。为克服这些挑战,我们提出了 EGAL,一种用于食源性疾病检测的深度学习框架,该框架利用小规模专家标注的推文,并结合众包标注数据与海量无标注数据进行增强。具体而言,通过将专家标注的推文作为奖励集,EGAL 学习为错误标注的推文分配零权重,以减轻其负面影响。其他推文则获得相应权重,以抵消不平衡的类别分布。在真实世界 \textit{TWEET-FID} 数据上的大量实验表明,EGAL 在不同设置下(包括不同的专家标注集大小和类别不平衡比例)均优于强基线模型。针对一起与包装沙拉绿叶蔬菜相关的鼠伤寒沙门氏菌感染多州暴发的案例研究,展示了训练好的模型如何捕获相关推文并提供有价值的疫情洞察。EGAL 由美国农业部 (USDA) 资助,具有部署于推文流实时分析的潜力,可助力食源性疾病暴发监测工作。

关键词

引用

@article{arxiv.2312.01225,
  title  = {UCE-FID: Using Large Unlabeled, Medium Crowdsourced-Labeled, and Small Expert-Labeled Tweets for Foodborne Illness Detection},
  author = {Ruofan Hu and Dongyu Zhang and Dandan Tao and Huayi Zhang and Hao Feng and Elke Rundensteiner},
  journal= {arXiv preprint arXiv:2312.01225},
  year   = {2023}
}

备注

2023 IEEE International Conference on Big Data (BigData)