探索大语言模型中的知识归因
计算与语言
2026-05-28 v2 人工智能
摘要
大语言模型(LLM)幻觉,即流畅但事实错误的生成,分为两种类型:忠实性违规,即模型滥用提供的上下文;事实性违规,即答案反映了内部知识中的错误。 proper mitigation depends on knowing which source drives each answer。我们研究贡献归因,即对每个输出背后主要知识来源的分类,结果表明,一个简单在隐藏表示上训练的线性探针可以可靠地识别它。我们引入 AttriWiki,一个自监督管道,通过提示模型在记忆中回想被隐藏的实体或在没有知识冲突的情况下从上下文中读取它们来自动生成标记的训练数据。在 AttriWiki 上训练的探针在 Llama-3.1-8B、Mistral-7B 和 Qwen-7B 上实现最高达 0.96 的 Macro-,在 SQuAD 和 WebQuestions 上实现 0.94-0.99 的 Macro-,并在零样本情况下推广到 Tighidet et al. (2024) 的基准测试中 outperforming their probe on conflicting settings without retraining。此外,归因不匹配可将错误率提高最高 70%,尽管正确的归因并不保证正确的答案,这指向需要更广泛的检测框架的需求。
引用
@article{arxiv.2602.22787,
title = {Probing for Knowledge Attribution in Large Language Models},
author = {Ivo Brink and Alexander Boer and Dennis Ulmer},
journal= {arXiv preprint arXiv:2602.22787},
year = {2026}
}