中文

面向自然灾害期间社交媒体数据挖掘的多模态方法——以飓风厄玛为例

社会与信息网络 2021-01-05 v1 信息检索 机器学习

摘要

流式社交媒体提供了极端天气影响的实时概览。然而,流式数据的数量使得应急管理者、政策制定者与领域科学家挖掘信息面临挑战。本文探讨利用数据驱动方法从飓风厄玛登陆美国佛罗里达期间的流式社交媒体数据中挖掘并过滤信息的有效性。我们使用 2017 年 9 月 10–12 日来自 16,598 名用户的 54,383 条 Twitter 消息(共 784K 条地理定位消息)构建 4 个独立模型以过滤相关数据:1)基于每条推文所处地点与时间强迫条件的地理空间模型,2)针对含图像推文的图像分类模型,3)预测发布者可靠性的用户模型,4)判断文本是否与飓风厄玛相关的文本模型。四个模型均经独立测试,并可组合以基于各子模型用户自定义阈值快速过滤与可视化推文。我们设想此类过滤与可视化流程可作为从 Twitter 等噪声源捕获数据的基础模型。随后,关注不同灾害阶段(如备灾、响应与恢复)或详尽研究、欲获取具特定属性推文的政策制定者、环境管理者、应急管理者及领域科学家可使用这些数据。

关键词

引用

@article{arxiv.2101.00480,
  title  = {A multi-modal approach towards mining social media data during natural disasters -- a case study of Hurricane Irma},
  author = {Somya D. Mohanty and Brown Biggers and Saed Sayedahmed and Nastaran Pourebrahim and Evan B. Goldstein and Rick Bunch and Guangqing Chi and Fereidoon Sadri and Tom P. McCoy and Arthur Cosby},
  journal= {arXiv preprint arXiv:2101.00480},
  year   = {2021}
}

备注

46 pages, 11 Figures