MoreHopQA:超越多跳推理
计算与语言
2024-06-21 v1
摘要
大多数现有的多跳数据集都是抽取式答案数据集,其中问题的答案可以直接从提供的上下文中提取。这常常导致模型使用启发式方法或捷径,而不是进行真正的多跳推理。本文提出了新的多跳数据集MoreHopQA,将从抽取式转向生成式答案。我们利用三个现有的多跳数据集:HotpotQA、2WikiMultihopQA和MuSiQue来创建该数据集。除了依赖事实推理之外,我们通过添加另一层涉及以下三种推理类型中一种、两种或全部三种的提问来增强现有的多跳问题:常识推理、算术推理和符号推理。我们通过半自动化过程创建该数据集, resulting in a dataset with 1,118 samples that have undergone human verification. 我们随后使用该数据集评估了五种不同的大型语言模型:Mistral 7B、Gemma 7B、Llama 3(8B和70B)以及GPT-4。我们还设计了各种案例来分析问答过程中的推理步骤。我们的结果表明,模型在初始多跳问题上表现良好,但在我们的扩展问题上表现困难,表明我们的模型比以前的模型更具挑战性。我们对问题分解的分析显示,尽管模型能够正确回答问题,但只有少部分——GPT-4为38.7%,Llama3-70B为33.4%——实现了完美的推理,即所有相应的子问题都得到正确答案。评估代码和数据可在https://github.com/Alab-NII/morehopqa 获取。
引用
@article{arxiv.2406.13397,
title = {MoreHopQA: More Than Multi-hop Reasoning},
author = {Julian Schnitzler and Xanh Ho and Jiahao Huang and Florian Boudin and Saku Sugawara and Akiko Aizawa},
journal= {arXiv preprint arXiv:2406.13397},
year = {2024}
}
备注
8 pages, 5 figures. First three authors contributed equally