中文

DisasterQA:评估 LLM 在灾害响应中性能的基准

计算与语言 2024-10-29 v1

摘要

灾害会导致大量人员伤亡,因此快速响应时间至关重要。大型语言模型 (LLM) 在该领域展现出了重要价值。LLM 可用于快速处理海量文本信息,在灾害期间提供情境上下文。然而,是否应将 LLM 用于灾害中的建议和决策仍是一个问题。为了评估 LLM 在灾害响应知识方面的能力,我们引入了一个基准:DisasterQA,该基准基于六个在线来源创建。该基准涵盖了广泛的灾害响应主题。我们在该基准上评估了五个 LLM,每个 LLM 均采用四种不同的提示方法,并通过 Logprobs 测量准确率和置信度。结果表明,LLM 在灾害响应知识方面仍需改进。我们希望该基准能推动 LLM 在灾害响应中的进一步发展,最终使这些模型能够在灾害中与应急管理人员协同工作。

关键词

引用

@article{arxiv.2410.20707,
  title  = {DisasterQA: A Benchmark for Assessing the performance of LLMs in Disaster Response},
  author = {Rajat Rawat},
  journal= {arXiv preprint arXiv:2410.20707},
  year   = {2024}
}

备注

7 pages, 6 tables