超越问题侧捷径的幻觉预测中真实意识的量化
计算与语言
2026-03-11 v2
摘要
许多工作提出了语言模型(LM)幻觉检测的方法并报告了看似强劲的性能。然而,我们认为迄今为止报告的性能不仅反映了模型对其内部信息的真实意识,还反映了纯粹来自问题侧信息(例如基准测试利用)的意识。虽然基准测试利用可以有效提升现有基准上的幻觉检测分数,但它不能推广到领域外设置和实际使用。然而,分离模型的幻觉检测性能中有多少来自问题侧意识并非易事。为此,我们提出了一种无需人工劳动的测量该效应的方法——近似问题侧效应(AQE)。我们使用AQE的分析表明,现有的幻觉检测方法严重依赖基准测试利用。
引用
@article{arxiv.2509.15339,
title = {Quantifying Genuine Awareness in Hallucination Prediction Beyond Question-Side Shortcuts},
author = {Yeongbin Seo and Dongha Lee and Jinyoung Yeo},
journal= {arXiv preprint arXiv:2509.15339},
year = {2026}
}