中文

TweetDIS:基于弱监督构建的用于自然灾害的大规模 Twitter 数据集

计算与语言 2022-07-12 v1 信息检索 机器学习

摘要

在自然灾害期间,社交媒体常被用作通信的生命线。传统上,从 Twitter 流中利用自然灾害名称过滤自然灾害相关推文,并将过滤后的推文送去人工标注。为机器学习模型创建标注集的人工标注过程费力、耗时、有时不准确,且更重要的是在规模和实时使用方面不可扩展。在这项工作中,我们利用弱监督策划了一个银标准数据集。为验证其效用,我们在弱监督数据上训练机器学习模型以识别三种不同类型的自然灾害,即地震、飓风和洪水。我们的结果表明,在银标准数据集上训练的模型在对人工策划的金标准数据集进行分类时达到了超过 90% 的性能。为支持可复现研究和额外的下游效用,我们向科学界发布了该银标准数据集。

关键词

引用

@article{arxiv.2207.04947,
  title  = {TweetDIS: A Large Twitter Dataset for Natural Disasters Built using Weak Supervision},
  author = {Ramya Tekumalla and Juan M. Banda},
  journal= {arXiv preprint arXiv:2207.04947},
  year   = {2022}
}

备注

12 pages