中文

HalluHard:一个困难的多轮幻觉基准

人工智能 2026-02-03 v1 计算与语言

摘要

大型语言模型(LLM)仍会生成听起来合理但不基于事实的陈述,这在多轮对话中尤为严重,因为上下文不断积累,早期错误会级联。我们引入 HalluHard,一个具有挑战性的多轮幻觉基准,包含950个种子问题,涵盖四个高风险领域:法律案件、科学问题、医学指南和编程。我们通过要求事实主张包含脚注引用来定义 groundedness。为支持开放式设置下的可靠评估,我们提出了迭代通过网络搜索获取证据的评判流程。它可以获取、筛选和解析完整文本来源(包括 PDF),评估引用材料是否实际支持生成内容。在多样化的前沿专有和开源模型中,幻觉问题仍然严重,即使使用网络搜索(最强配置下约30%,Opus-4.5 with web search),内容 grounding 错误仍以高比例持续存在。最后,我们表明幻觉行为受模型容量、轮次位置、有效推理以及所需知识类型影响。

关键词

引用

@article{arxiv.2602.01031,
  title  = {HalluHard: A Hard Multi-Turn Hallucination Benchmark},
  author = {Dongyang Fan and Sebastien Delsad and Nicolas Flammarion and Maksym Andriushchenko},
  journal= {arXiv preprint arXiv:2602.01031},
  year   = {2026}
}