中文

大型语言模型在文档问答场景中会说谎吗?跨温度、上下文长度与硬件平台的1720亿标记大规模研究

计算与语言 2026-03-10 v1 人工智能

摘要

大型语言模型在基于提供文档的问答中会说谎多少?尽管这一问题对企业级AI部署至关重要,但可靠的衡量一直受限于依赖易受污染的静态数据集的基准、带有已知偏见的LLM裁判器,或规模过小难以获得统计置信度的评估。我们使用RIKER,一种以真实为基础的评估方法,实现了无需人工标注即可进行确定性评分。我们在35个开源模型上进行了评估,涵盖三个上下文长度(32K、128K和200K标记)、四个温度设置以及三个硬件平台(NVIDIA H200、AMD MI300X和Intel Gaudi 3),累计超过1720亿标记的评估——远超前期工作。我们的发现表明:(1)即使是表现最好的模型在32K时仍会以不可平凡的比例生成虚假答案——最佳情况为1.19%,顶级模型在5-7%左右,且随着上下文长度增加,虚假答案呈快速上升趋势,在128K时几乎翻倍,达到200K时所有模型都超过10%;(2)模型选择占据主导地位,整体准确率跨越72个百分点,模型家族比模型规模更能预测虚假答案抵抗力;(3)温度效应较为细致——T=0.0在约60%的情况下获得最佳整体准确率,但更高的温度会降低大多数模型的虚假答案率,并显著减少连贯性损失(无限生成循环),在T=0.0时可达T=1.0的48倍;(4) grounding能力与虚假答案抵抗力是独立的能力——擅长查找事实的模型仍可能生成不存在的事实;(5)结果在硬件平台间保持一致,表明部署决策无需依赖硬件平台。

关键词

引用

@article{arxiv.2603.08274,
  title  = {How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms},
  author = {JV Roig},
  journal= {arXiv preprint arXiv:2603.08274},
  year   = {2026}
}

备注

18 pages, 12 tables, 2 figures