中文

关于事实性问答中幻觉的早期检测

计算与语言 2024-08-23 v3 人工智能

摘要

虽然大型语言模型 (LLM) 在协助人类完成多种任务方面取得了巨大进展,但幻觉仍然是获得用户信任的主要障碍。模型生成内容即使在产生幻觉时也具有流畅性和连贯性,这使得检测变得困难。在本工作中,我们探讨了与模型生成相关的伪影是否能提供线索,表明生成内容将包含幻觉。具体而言,我们在开放域问答任务中,通过以下方式探测 LLM 以寻找幻觉迹象:1) 基于积分梯度 (Integrated Gradients) 的 token 归因分析输入;2) 通过 Softmax 概率分析输出;3) 通过自注意力和全连接层激活分析内部状态。我们的结果表明,这些伪影的分布在幻觉生成和非幻觉生成之间往往存在差异。基于这一见解,我们训练了二元分类器,利用这些伪影作为输入特征,将模型生成内容分类为幻觉或非幻觉。这些幻觉分类器的 AUROC 最高可达 0.800.80。我们还表明,幻觉之前的 token 甚至可以在幻觉发生之前预测随后的幻觉。

关键词

引用

@article{arxiv.2312.14183,
  title  = {On Early Detection of Hallucinations in Factual Question Answering},
  author = {Ben Snyder and Marius Moisescu and Muhammad Bilal Zafar},
  journal= {arXiv preprint arXiv:2312.14183},
  year   = {2024}
}

备注

KDD 2024