跨事件、信息类型与语言特征评估 LLM 在危机相关微博中的鲁棒性
计算与语言
2024-12-17 v1 人工智能
社会与信息网络
摘要
灾害期间,微博平台(如 X 平台)的广泛使用为政府和应急部门提供了实时信息,但这些平台的数据常常噪声较大,亟需自动方法筛选相关信息。传统方法使用监督式机器学习模型,但缺乏普适性。相比之下,大型语言模型(LLM)在自然语言理解与处理方面表现更佳。本文对六种知名 LLM 在处理真实世界事件中与灾害相关的社交媒体数据时的性能进行了详细分析。我们的发现表明,尽管 LLM(尤其是 GPT-4o 和 GPT-4)在不同灾害和信息类型之间展现出更好的普适性,但大多数 LLM 在处理洪水相关数据时仍面临挑战,提供示例(即 shots)后几乎没有性能提升,无法识别紧急请求和需求等关键信息类别。此外,我们检查了各种语言特征对模型性能的影响,突出了 LLM 在某些特征(如拼写错误)下的脆弱性。最后,我们在零样本和少样本设置下,对所有事件提供基准测试结果,发现专有模型在所有任务中均优于开源模型。
引用
@article{arxiv.2412.10413,
title = {Evaluating Robustness of LLMs on Crisis-Related Microblogs across Events, Information Types, and Linguistic Features},
author = {Muhammad Imran and Abdul Wahab Ziaullah and Kai Chen and Ferda Ofli},
journal= {arXiv preprint arXiv:2412.10413},
year = {2024}
}
备注
12 pages, 10 figs, 5 tables