真理是普适的:鲁棒检测 LLM 中的说谎行为
计算与语言
2024-10-22 v2 人工智能
摘要
大型语言模型(LLM)彻底革新了自然语言处理,展现出惊人的类人能力。特别是,LLM 能够“说谎”,即有意输出虚假陈述。因此, developing 检测 LLM 何时说谎的方法备受关注和重要性。事实上,一些作者基于 LLM 内部模型激活训练分类器来检测 LLM 的说谎。然而,其他研究者表明,这些分类器可能无法概括,例如针对否定语句。本文旨在开发一种稳健的方法来检测 LLM 是否在说谎。为此,我们作出了以下关键贡献:(i)我们证明了存在一个二维子空间,其中 LLM 中真实陈述和虚假陈述的激活向量可以被分离。值得注意的是,这一发现是通用的,对包括 Gemma-7B、LLaMA2-13B、Mistral-7B 和 LLaMA3-8B 在内的各种 LLM 都适用。我们的分析解释了在先前研究中观察到的概括失败,并为更稳健的说谎检测奠定了基础;(ii)基于 (i),我们构建了一个精确的 LLM 说谎检测器。经验上,我们提议的分类器实现了最先进的性能,在区分真实与虚假事实陈述以及检测真实场景中生成的说谎方面均达到了 94% 的准确率。
引用
@article{arxiv.2407.12831,
title = {Truth is Universal: Robust Detection of Lies in LLMs},
author = {Lennart Bürger and Fred A. Hamprecht and Boaz Nadler},
journal= {arXiv preprint arXiv:2407.12831},
year = {2024}
}
备注
NeurIPS 2024 poster