高效贝叶斯估计语义熵:实现 hallucination 检测的低成本方案
机器学习
2025-09-09 v2
摘要
检测 LLM 是否产生幻觉是重要的研究挑战。一种可行的方法是估计生成序列分布的语义熵 (Farquhar 等, 2024)。我们提出一种新算法,具有两个主要优势:首先,由于我们采用贝叶斯方法,在给定 LLM 采样预算下,能够获得更高质量的语义熵估计;其次,我们能够自适应调节采样数量,使得“更困难”的上下文接收更多采样。我们通过实证研究表明,我们的方法系统性地优于基线方法,只需 53% 于 Farquhar 等 (2024) 所用的采样数量,即可实现与基线方法在 AUROC 衡量下的相同质量的幻觉检测。此外,令人反乎然的是,我们的估计器即使仅使用一个 LLM 采样就非常有用。
引用
@article{arxiv.2504.03579,
title = {Hallucination Detection on a Budget: Efficient Bayesian Estimation of Semantic Entropy},
author = {Kamil Ciosek and Nicolò Felicioni and Sina Ghiassian},
journal= {arXiv preprint arXiv:2504.03579},
year = {2025}
}
备注
24 pages