中文

MultiHoax:一个多跳错误前提问题数据集

计算与语言 2025-06-05 v2

摘要

随着大型语言模型越来越多地部署在高风险领域,其检测错误假设和批判性推理的能力对于确保可靠的输出至关重要。错误前提问题(FPQs)作为一种重要的评估方法,通过揭示错误假设导致错误响应的情况来发挥作用。虽然现有的基准测试集中在单跳 FPQs 上,但现实世界中的推理通常需要多跳推理,模型必须验证多个推理步骤的一致性,而不是依赖表面线索。为了填补这一空白,我们引入了 MultiHoax,一个用于评估 LLM 在复杂、多步推理任务中处理错误前提能力的基准。我们的数据集涵盖七个国家和十个不同的知识类别,使用 Wikipedia 作为主要知识源,以实现跨区域的事实推理。实验表明,state-of-the-art LLM 在检测不同国家、知识类别和多跳推理类型的错误前提方面存在困难,这凸显了在 LLM 中改进错误前提检测和更稳健的多跳推理能力的需求。

关键词

引用

@article{arxiv.2506.00264,
  title  = {MultiHoax: A Dataset of Multi-hop False-Premise Questions},
  author = {Mohammadamin Shafiei and Hamidreza Saffari and Nafise Sadat Moosavi},
  journal= {arXiv preprint arXiv:2506.00264},
  year   = {2025}
}

备注

accepted at ACL Findings 2025