锚定式虚构:部分证据非单调放大 LLM 中的自信幻觉
计算与语言
2026-04-30 v1
摘要
我们识别出大型语言模型一个先前未知的校准特性:在多步推理链中提供一个已确认的中间事实,会在完整证据消除它之前提高模型自信但错误回答的概率。我们将此称为锚定式虚构:部分锚点使模型致力于对剩余推理步骤进行自信的参数化补全。我们将其形式化为参数化幻觉置信度(PHC),并通过六条证据线索确立它,包括因果注入实验(PHC 从 0.613 到 0.656 到 0.595 到 0.536,N=160)和跨五个模型族的能力扩展(Spearman rho=0.900,p=0.037)。锚定阈值定律 k*(n)=floor(n/3) 通过跳跃深度预测 PHC 放大,并有四个已确认的预测。应用于 RAG 路由,利用 PHC 的 LearnedRouter 在四个基准的 1,800 个查询上弥合了 81.1% 的预言机性能差距(macro F1=0.426,p<1e-6),无需模型微调,且标签量比先前基于 RL 的工作少 50 倍。认知谦逊提示使 PHC 峰值降低 -0.118;显式自评(PHC=0.684,p<0.001)作为路由信号优于词汇置信度。
引用
@article{arxiv.2604.25931,
title = {Anchored Confabulation: Partial Evidence Non-Monotonically Amplifies Confident Hallucination in LLMs},
author = {Ashish Balkishan Lathkar},
journal= {arXiv preprint arXiv:2604.25931},
year = {2026}
}
备注
62 pages, 5 figures. Preprint under review