WHODUNIT:悬疑故事中凶手检测的评测基准
计算与语言
2025-02-12 v1 人工智能
摘要
我们提出了一个新颖的数据集 WhoDunIt,用于评估大语言模型(LLM)在叙事语境下的演绎推理能力。该数据集基于开放领域的悬疑小说和短篇故事构建,要求 LLM 在阅读和理解故事后识别出罪犯。为了评估模型的鲁棒性,我们应用了一系列角色级别的姓名增强操作,包括原始姓名、姓名交换,以及替换为流行语境中广为人知的真实和/或虚构实体。我们进一步采用多种提示风格,以研究提示对演绎推理准确率的影响。我们使用最先进的模型(具体为 GPT-4o、GPT-4-turbo 和 GPT-4o-mini)进行了评测研究,通过多次试验并选取多数响应来确保可靠性。结果表明,尽管 LLM 在未修改文本上表现可靠,但在某些姓名替换下准确率会下降,尤其是那些具有广泛知名度的替换。该数据集已在此公开。
引用
@article{arxiv.2502.07747,
title = {WHODUNIT: Evaluation benchmark for culprit detection in mystery stories},
author = {Kshitij Gupta},
journal= {arXiv preprint arXiv:2502.07747},
year = {2025}
}