HumAID:来自 Twitter 的带深度学习基准的人工标注灾害事件数据
计算与语言
2021-04-09 v2 人工智能
计算机与社会
机器学习
社会与信息网络
摘要
社交网络被广泛用于信息消费与传播,尤其在自然灾害等时间紧迫的事件期间。尽管社交媒体内容体量巨大,但其往往过于嘈杂而无法直接用于任何应用。因此,对可用内容进行过滤、分类和简明摘要,以促进有效消费与决策制定十分重要。为解决此类问题,得益于早期创建标注数据集的努力,已开发出使用监督建模方法的自动分类系统。然而,现有数据集在不同方面存在局限(如规模小、含重复),不太适合支撑更先进且数据饥渴的深度学习模型。本文提出一个包含约 77K 人工标注推文的新大规模数据集,这些推文采样自 2016 至 2019 年间 19 起灾害事件约 2400 万条推文的池子。此外,我们提出一种数据收集与采样流水线,其对社交媒体数据采样以进行人工标注十分重要。我们报告了使用基于经典和深度学习(fastText 与 transformer)的模型的多类分类结果,为未来研究奠定基础。数据集与相关资源已公开可用。https://crisisnlp.qcri.org/humaid_dataset.html
引用
@article{arxiv.2104.03090,
title = {HumAID: Human-Annotated Disaster Incidents Data from Twitter with Deep Learning Benchmarks},
author = {Firoj Alam and Umair Qazi and Muhammad Imran and Ferda Ofli},
journal= {arXiv preprint arXiv:2104.03090},
year = {2021}
}
备注
Accepted in ICWSM-2021, Twitter datasets, Textual content, Natural disasters, Crisis Informatics, Benchmarks, Transformers