TRACE:基于跨层证据的幻觉减少轨迹校正
人工智能
2026-05-19 v1 计算与语言
摘要
幻觉校正并非单向问题。我们表明,中间层既不比最终层更真实,也不比最终层更不可信。然而,幻觉减少通常通过一种固定的干预形式来实现:对比某一层与另一层、沿真实性方向进行引导,或求助于外部证据。这种框架在结构上是不完整的。跨层事实证据并非均匀演化:在某些失败中,真实支持在内部存在但随后被抑制;而在另一些失败中,候选竞争在深度上保持真正的多向性,因此没有单一的有符号标量族能够普遍适用。我们引入了 Trajectory Correction from Cross-layer Evidence for Hallucination Reduction(TRACE),这是一种确定性的免训练算法,通过从 LLM 自身前向传播中每个输入的跨层候选轨迹中推导出校正层与适当的校正算子,在推理时校正幻觉。在单一冻结超参数设置下,TRACE 仅使用模型内部证据,在标量反转、早期状态恢复和候选空间校正之间进行选择。作为一种单一通用算法在 15 个模型、8 个模型族和 3 个事实性基准上进行评估,TRACE 改进了每一个评估单元,平均提升 +12.26 MC1 分和 +8.65 MC2 风格分且无性能退化,最高提升达到 +47.20 MC1 分和 +43.38 MC2 风格分。该方法不使用任何标签、检索、预训练、微调或逐模型校准。
引用
@article{arxiv.2605.18163,
title = {TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction},
author = {Tej Sanibh Ranade},
journal= {arXiv preprint arXiv:2605.18163},
year = {2026}
}
备注
25 pages, 8 figures, 4 tables