大语言模型的内部状态可知其何时在说谎
计算与语言
2023-10-18 v2 人工智能
机器学习
摘要
尽管大语言模型(LLMs)在各种任务中表现出卓越性能,其最显著的缺点之一是能以自信的语气生成不准确或虚假的信息。在本文中,我们提供证据表明 LLM 的内部状态可用于揭示陈述的真实性。这包括提供给 LLM 的陈述,以及 LLM 自身生成的陈述。我们的方法是训练一个分类器,基于 LLM 在阅读或生成陈述时的隐藏层激活,输出该陈述为真的概率。实验表明,给定一组测试句子(其中一半为真、一半为假),根据 LLM 基础模型的不同,我们训练的分类器在标注哪些句子为真或假方面达到了 71% 至 83% 的平均准确率。此外,我们探究了分类器性能与基于 LLM 赋予句子的概率的方法之间的关系。我们表明,虽然 LLM 赋予的句子概率与句子真实性相关,但该概率也依赖于句子长度及句中词频,导致我们训练的分类器提供了更可靠的真实性检测方法,凸显了其在提升 LLM 生成内容可靠性及在真实场景中实际适用性方面的潜力。
引用
@article{arxiv.2304.13734,
title = {The Internal State of an LLM Knows When It's Lying},
author = {Amos Azaria and Tom Mitchell},
journal= {arXiv preprint arXiv:2304.13734},
year = {2023}
}