长文本幻觉检测的合理性检验
计算与语言
2026-05-12 v1 人工智能
摘要
大型语言模型的幻觉检测方法越来越多地作用于思维链推理轨迹,但仍不清楚它们是在评估推理本身,还是仅仅利用了最终答案的表面相关性。我们引入了一种受控不变性方法,通过两个神谕测试来揭示这种区别:\textsc{Force},在保留推理轨迹的同时,将每个响应的最终答案替换为真实答案;\textsc{Remove},在保持轨迹完整的同时,去除答案宣告步骤。这揭示了它们的预测能力是源自答案层面的伪影,还是源自中间推理的结构或有效性。我们进一步表明,一旦控制了这些伪影,有效的检测并不一定需要复杂的学习表示:TRACT,一个基于词汇轨迹特征(对冲趋势、步长动态和跨响应词汇收敛性)构建的轻量级评分器,在未受扰动的轨迹上实现了强大的鲁棒性,同时与现有基线相比具有竞争力或更优。这些发现表明,当前推理感知幻觉检测的核心挑战并非轨迹中缺乏信号,而是未能将其与端点线索分离。
引用
@article{arxiv.2605.08346,
title = {Sanity Checks for Long-Form Hallucination Detection},
author = {Geigh Zollicoffer and Minh Vu and Hongli Zhan and Raymond Li and Manish Bhattarai},
journal= {arXiv preprint arXiv:2605.08346},
year = {2026}
}