TweetDrought:基于Twitter数据的深度学习干旱影响识别器
计算与语言
2022-12-09 v1 机器学习
摘要
在气候变暖背景下,更好地理解干旱影响变得愈发重要。传统干旱指数主要描述生物物理变量,而非对社会、经济与环境系统的影响。我们利用自然语言处理及基于双向编码器表示来自Transformers(BERT)的迁移学习,在基于新闻的干旱影响报告(DIR)数据上微调模型,随后将其应用于基于美国过滤后Twitter数据识别七类干旱影响。我们的模型在DIR测试集上取得了令人满意的0.89宏F1分数。该模型随后应用于加利福尼亚推文,并以基于关键字的标签进行验证。宏F1分数为0.58。然而,受关键字局限,我们也抽查了标签有争议的推文。与关键字标签相比,83.5%的BERT标签正确。总体而言,微调后的基于BERT的识别器提供了恰当的预测及有价值的干旱影响信息。模型的解释与分析符合领域经验专业知识。
引用
@article{arxiv.2212.04001,
title = {TweetDrought: A Deep-Learning Drought Impacts Recognizer based on Twitter Data},
author = {Beichen Zhang and Frank Schilder and Kelly Helm Smith and Michael J. Hayes and Sherri Harms and Tsegaye Tadesse},
journal= {arXiv preprint arXiv:2212.04001},
year = {2022}
}
备注
5 pages (+3 in appendix), 5 figures in appendix, 2 tables (+1 in appendix), ICML Workshop on Tackling Climate Change with Machine Learning Workshop, 2021