RESPONSE:评估语言模型在危机情境下进行常识推理能力的基准测试
计算与语言
2025-03-17 v1
摘要
当人们面临自然灾害时,出现了一类有趣的常识推理问题。为了研究这一课题,我们提出了 \textsf{RESPONSE},一个人工精选的数据集,包含 1789 个标注实例,具有 6037 套问题,旨在评估 LLM 在不同时间段的灾难情境下的常识推理能力。该数据集包括问题描述、缺失资源、时间敏感的解决方案及其理由,其中一部分由环境工程师进行了验证。通过自动指标和人工评估,我们将 LLM 生成的建议与人类的回答进行了比较。我们的研究结果表明,即使是像 GPT-4 这样的最先进模型,在即时响应行动中也仅获得了 37% 的人工评估正确率,这突显了 LLM 在危机中常识推理能力方面仍有巨大的改进空间。
引用
@article{arxiv.2503.11348,
title = {RESPONSE: Benchmarking the Ability of Language Models to Undertake Commonsense Reasoning in Crisis Situation},
author = {Aissatou Diallo and Antonis Bikakis and Luke Dickens and Anthony Hunter and Rob Miller},
journal= {arXiv preprint arXiv:2503.11348},
year = {2025}
}