中文

情境塑造 LLM 检索增强事实核查效果

计算与语言 2026-02-25 v2

摘要

大语言模型 (LLM) 在多样化任务中表现出强大的推理能力,但其在扩展情境中的表现却不为人知。虽然先前研究强调了问答中情境长度的中等位置性能衰减,但本研究考察了情境在 LLM-based 事实核查中的影响。我们使用三个数据集(HOVER、FEVEROUS 和 ClimateFEVER)以及来自不同参数规模(7B、32B 和 70B 参数)和模型系列(Llama-3.1、Qwen2.5 和 Qwen3)的五个开源模型进行评估,既评估了参数化事实知识,又考察了证据位置在不同情境长度下的影响。我们发现 LLMs 对事实性声明具有非平凡的参数化知识,并且随着情境长度增加,其核查准确率通常会下降。类似以往研究,情境中证据的放置位置起着关键作用:当相关证据出现在提示的开头或结尾时,准确率始终较高;而置于中间时则较低。这些结果凸显了检索增强事实核查系统中提示结构的重要性。

关键词

引用

@article{arxiv.2602.14044,
  title  = {Context Shapes LLMs Retrieval-Augmented Fact-Checking Effectiveness},
  author = {Pietro Bernardelle and Stefano Civelli and Kevin Roitero and Gianluca Demartini},
  journal= {arXiv preprint arXiv:2602.14044},
  year   = {2026}
}