中文

主动学习用于识别灾害相关推文:与关键词过滤和通用微调的比较

计算与语言 2024-08-20 v1 机器学习

摘要

社交媒体信息可以为自然灾害期间的应急响应提供近乎实时的关键信息。然而,在大量非结构化数据中识别灾害相关帖子是困难的。先前的方法通常使用关键词过滤、主题建模或基于分类的技术来识别此类帖子。主动学习(AL)是机器学习(ML)的一个有前景的子领域,在社交媒体文本分类领域使用较少。本研究因此探讨了 AL 用于识别灾害相关推文的潜力。我们比较了关键词过滤方法、使用 CrisisLex 通用数据微调的 RoBERTa 模型、使用 AL 训练的基础 RoBERTa 模型以及使用 AL 训练的微调 RoBERTa 模型的分类性能。测试数据包括来自 CrisisLex 的数据以及德国 2021 年洪水和智利 2023 年森林火灾的手动标注数据。结果表明,通用微调结合 10 轮 AL 优于所有其他方法。因此,可以使用极少的标注工作训练一个广泛适用的灾害相关推文识别模型。该模型可应用于本研究之外的用例,并为社交媒体分析的后续研究提供了有用的工具。

关键词

引用

@article{arxiv.2408.09914,
  title  = {Active Learning for Identifying Disaster-Related Tweets: A Comparison with Keyword Filtering and Generic Fine-Tuning},
  author = {David Hanny and Sebastian Schmidt and Bernd Resch},
  journal= {arXiv preprint arXiv:2408.09914},
  year   = {2024}
}

备注

Submitted for the Intelligent Systems Conference (IntelliSys 2024). The version of record of this contribution is published in the Springer series Lecture Notes in Networks and Systems, and is available online at https://doi.org/10.1007/978-3-031-66428-1_8. This preprint has not undergone peer review or any post-submission improvements or corrections. 13 pages, 2 figures