中文

TWEET-FID:用于多种食源性疾病检测任务的标注数据集

计算与语言 2022-09-15 v2 人工智能 机器学习

摘要

食源性疾病是一个严重但可预防的公共卫生问题——对 related 暴发的检测延迟会导致生产力损失、昂贵的召回、公共安全危害甚至生命损失。虽然社交媒体是识别未报告食源性疾病的一个有前景的来源,但缺乏用于开发有效暴发检测模型的标注数据集。为了加速基于机器学习的食源性疾病暴发检测模型的开发,我们提出了 TWEET-FID(TWEET-Foodborne Illness Detection,推文-食源性疾病检测),这是首个公开可用的用于多种食源性疾病事件检测任务的标注数据集。从 Twitter 收集的 TWEET-FID 标注了三个维度:推文类别、实体类型和槽位类型,标签由专家及众包工作者生成。我们引入了利用这三个维度的若干领域任务:文本相关性分类(TRC)、实体提及检测(EMD)和槽填充(SF)。我们描述了支持这些任务模型开发的端到端数据集设计、创建和标注方法。提供了在这些任务上利用 TWEET-FID 数据集上最先进的单任务和多任务深度学习方法的全面结果集。该数据集为未来食源性疾病暴发检测研究开辟了机会。

关键词

引用

@article{arxiv.2205.10726,
  title  = {TWEET-FID: An Annotated Dataset for Multiple Foodborne Illness Detection Tasks},
  author = {Ruofan Hu and Dongyu Zhang and Dandan Tao and Thomas Hartvigsen and Hao Feng and Elke Rundensteiner},
  journal= {arXiv preprint arXiv:2205.10726},
  year   = {2022}
}

备注

LREC 2022