中文

使用指令微调大型语言模型进行危机推文的零样本分类

计算与语言 2025-08-29 v1 人工智能

摘要

社交媒体帖子经常被识别为灾难响应的有价值的开源情报来源,过去的 NLP 技术已在危机推文数据集上进行评估。我们评估了三家商业大型语言模型(OpenAI GPT-4o、Google Gemini 1.5-flash-001 和 Anthropic Claude-3-5 Sonnet)在危机推文零样本分类中的能力。在单个提示中,这些模型被要求完成两个分类任务:1) 识别帖子在人道主义背景下是否具有信息性;2) 对帖子在 16 种可能的人道主义类别中进行排序并提供概率。被分类的帖子来自综合危机推文数据集 CrisisBench。结果使用宏平均、加权平均和二分类 F1 分数进行评估。信息性分类任务通常在没有额外信息的情况下表现更好,而对于人道主义标签分类,提供推文被抽取时发生的事件,有助于提升性能。进一步地,我们发现模型在不同数据集上的表现存在显著差异,这引发了关于数据集质量的疑问。

关键词

引用

@article{arxiv.2410.00182,
  title  = {Zero-Shot Classification of Crisis Tweets Using Instruction-Finetuned Large Language Models},
  author = {Emma McDaniel and Samuel Scheele and Jeff Liu},
  journal= {arXiv preprint arXiv:2410.00182},
  year   = {2025}
}