中文

基于不确定表达下一致性的黑箱幻觉检测

计算与语言 2025-09-29 v1 人工智能

摘要

尽管近期语言建模取得了巨大进步,像 GPT3 这样的大型语言模型(LLM)因生成非事实性响应而备受批评,即所谓的“幻觉”问题。现有的检测和缓解此幻觉问题的方法需要外部资源或大型语言模型的内部状态,如每个 token 的输出概率。鉴于大型语言模型受限的外部 API 可用性以及外部资源的有限范围,迫切需要将黑箱方法建立为有效幻觉检测的基石。本文我们在调查大型语言模型在不确定表达下的行为后,提出了一种简单的黑箱幻觉检测指标。我们的全面分析揭示,大型语言模型在生成事实性响应时会产生一致响应,而非一致响应则相反。基于此分析,我们提出了一种基于不确定表达的高效黑箱幻觉检测指标。实验表明,我们的指标在预测模型响应的事实性方面,优于使用大型语言模型内部知识的基线方法。

关键词

引用

@article{arxiv.2509.21999,
  title  = {Black-Box Hallucination Detection via Consistency Under the Uncertain Expression},
  author = {Seongho Joo and Kyungmin Min and Jahyun Koo and Kyomin Jung},
  journal= {arXiv preprint arXiv:2509.21999},
  year   = {2025}
}