中文

大语言模型自动幻觉检测的(不)可能性

机器学习 2025-06-03 v2 人工智能 计算与语言 机器学习

摘要

自动化幻觉检测是否可能?本文引入一个理论框架来分析自动检测大型语言模型(LLM)产生的幻觉的可行性。灵感来自Anlu的经典Gold框架及其近期针对语言生成的 adaptation by Kleinberg和Mullainathan,我们探讨whether an algorithm, trained on examples drawn from an unknown target language KK (selected from a countable collection) and given access to an LLM, can reliably determine whether the LLM's outputs are correct or constitute hallucinations.首先,我们建立幻觉检测与经典语言识别任务之间的等价性。我们证明,任何幻觉检测方法都可以转换为语言识别方法,反之亦然,解决语言识别问题的算法也可适用于幻觉检测。鉴于语言识别固有的困难,这意味着如果检测器仅使用来自目标语言的正确示例进行训练,幻觉检测在大多数语言集合中是根本不可能的。其次,我们表明,专家标记反馈的使用,即使用正例(正确陈述)和负例(明确标记为错误的陈述)进行训练,显著改变这一结论。在这种丰富的训练 regime下,自动化幻觉检测对于所有可数语言集合都成为可能。这些结果凸显了专家标记示例在训练幻觉检测器中的基本作用,为诸如强化学习与人类反馈(RLHF)等基于反馈的方法提供了理论支持,这些方法已被证明对于可靠部署LLM至关重要。

关键词

引用

@article{arxiv.2504.17004,
  title  = {(Im)possibility of Automated Hallucination Detection in Large Language Models},
  author = {Amin Karbasi and Omar Montasser and John Sous and Grigoris Velegkas},
  journal= {arXiv preprint arXiv:2504.17004},
  year   = {2025}
}