当不确定时验证:超越自我一致性的黑盒幻觉检测
计算与语言
2025-02-25 v1 人工智能
摘要
大型语言模型 (LLMs) 存在幻觉问题,阻碍其在敏感应用中的可靠性。在黑盒设置下,已提出了几种基于自我一致性的技术用于幻觉检测。我们实证研究了这些技术,并发现它们的性能接近受监督(仍为黑盒)的 oracle,表明在该范式内几乎没有改进的空间。为克服这一局限,我们探索了在目标模型和额外验证 LLM 之间进行跨模型一致性检查。通过获取额外信息,我们观察到与纯粹基于自我一致性的方法相比,oracle 性能得到了提高。我们随后提出了一种具有预算友好性的两阶段检测算法,仅对案例子集调用验证模型。它动态地在自我一致性和跨一致性之间切换,基于自我一致性分类器的不确定性区间。我们通过核均匀嵌入的视角,对一致性基于的幻觉检测方法提供了几何解释,为更深入的理论见解提供了支持。广泛的实验表明,该方法在保持高检测性能的同时,显著降低了计算成本。
引用
@article{arxiv.2502.15845,
title = {Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection},
author = {Yihao Xue and Kristjan Greenewald and Youssef Mroueh and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2502.15845},
year = {2025}
}