CrisisBench:面向人道主义信息处理的危机相关社交媒体数据集基准
社会与信息网络
2021-04-20 v4 人工智能
计算机与社会
信息检索
摘要
对社交媒体流的时效性分析对于人道主义组织在灾害期间规划快速响应十分重要。\textit{危机信息学}研究社区已开发了若干技术与系统,用于处理并分类发布于社交媒体上的海量危机相关数据。然而,由于文献中所用数据集(例如用于训练模型者)的分散性,无法比较结果并衡量在构建更优危机信息学任务模型方面取得的进展。本工作中,我们试图通过合并各类现有危机相关数据集来弥合这一差距。我们整合了八个人工标注数据集,并为\textit{信息性}与\textit{人道主义}分类任务分别提供 166.1k 与 141.5k 条推文。我们相信该整合数据集将有助于训练更复杂的模型。此外,我们使用若干深度学习架构(包括 CNN、fastText 与 transformers)为二分类与多分类任务提供基准。我们在 https://crisisnlp.qcri.org/crisis_datasets_benchmarks.html 提供了数据集与脚本。
引用
@article{arxiv.2004.06774,
title = {CrisisBench: Benchmarking Crisis-related Social Media Datasets for Humanitarian Information Processing},
author = {Firoj Alam and Hassan Sajjad and Muhammad Imran and Ferda Ofli},
journal= {arXiv preprint arXiv:2004.06774},
year = {2021}
}
备注
Accepted in ICWSM-2021, Twitter datasets, Textual content, Natural disasters, Crisis Informatics