NovelHopQA:诊断长叙事语境中的多跳推理失败
计算与语言
2025-06-24 v2
摘要
当前的大型语言模型 (LLM) 难以回答跨越数万个 token 的问题,尤其是当涉及多跳推理时。虽然先前的基准测试分别探索了长上下文理解或多跳推理,但没有一个能在自然叙事设置中联合改变上下文长度和推理深度。我们引入了 NovelHopQA,这是第一个评估 64k-128k token 节选自 83 部完整公共领域小说的 1-4 跳问答的基准测试。一个关键词引导的流水线构建了基于连贯故事线的跳间分离链。我们评估了七个最先进的模型,并应用了预言机上下文过滤以确保所有问题都是真正可回答的。人工标注者验证了对齐和跳数深度。我们还额外提供了检索增强生成 (RAG) 评估,以测试在仅提供选定段落而非完整上下文时的模型性能。我们注意到,随着跳数和上下文长度的增加,准确率持续下降,即使对于前沿模型也是如此——这表明单纯的规模并不能保证稳健的推理。失败模式分析强调了常见的崩溃点,如遗漏最终跳的整合和长程漂移。NovelHopQA 提供了一个受控的诊断设置,以测试大规模的多跳推理。所有代码和数据集可在 https://novelhopqa.github.io 获取。
引用
@article{arxiv.2506.02000,
title = {NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts},
author = {Abhay Gupta and Michael Lu and Kevin Zhu and Sean O'Brien and Vasu Sharma},
journal= {arXiv preprint arXiv:2506.02000},
year = {2025}
}