中文

危机中的“可行动援助”:用于识别社交媒体求助与提供帖的新型数据集与资源高效模型

计算与语言 2025-02-25 v1

摘要

在危机期间,社交媒体作为关键的协调工具,但海量的帖子——从“可行动的”求助和提供到情感支持、行为指导或过时信息等通用内容——使有效分类变得复杂。尽管生成式 LLM (Large Language Models) 可以通过少样本分类解决这一问题,但其高昂的计算需求限制了实时的危机响应。虽然微调仅编码器模型(如 BERT)是一种流行的选择,但这些模型在资源受限的环境中仍表现出较高的推理时间。此外,尽管存在蒸馏变体(如 DistilBERT),但它们并未针对危机领域进行定制。为了应对这些挑战,我们做出了两项关键贡献。首先,我们提出了 CrisisHelpOffer,一个由生成式 LLM 协作标注并经人类验证的 10.1 万条推文的新型数据集,专门设计用于区分可行动内容与噪声。其次,我们引入了首批针对资源受限环境部署进行优化的危机特定微型模型。在 13 项危机分类任务中,我们的微型模型超越了 BERT(同时也优于或匹敌了 RoBERTa、MPNet 和 BERTweet 的性能),以显著更小的体积和更快的速度提供了更高的准确率。Medium 模型体积减小 47%,准确率提高 3.8%,速度提升 3.5 倍;Small 模型体积减小 68%,准确率提高 1.8%,速度提升 7.7 倍;Tiny 模型体积减小 83%,在 18.6 倍速度下保持了与 BERT 相同的准确率。所有模型均优于现有的蒸馏变体,树立了新的基准。最后,作为案例研究,我们分析了某次全球危机中的社交媒体帖子,以探讨特定发展中国家和发达国家中的求助和援助提供行为。

关键词

引用

@article{arxiv.2502.16839,
  title  = {"Actionable Help" in Crises: A Novel Dataset and Resource-Efficient Models for Identifying Request and Offer Social Media Posts},
  author = {Rabindra Lamsal and Maria Rodriguez Read and Shanika Karunasekera and Muhammad Imran},
  journal= {arXiv preprint arXiv:2502.16839},
  year   = {2025}
}