探究 LLM 说谎检测方法的局限性
计算与语言
2026-03-12 v1 机器学习
摘要
对大语言模型(LLMs)中的欺骗行为的机制方法往往依赖“说谎检测器”,即训练用于识别模型输出内部表示为虚假的真伪探针。说谎检测方法隐含地假设欺骗行为与说谎行为一致。本文挑战了这一假设。实验检验了 LLMs 是否能够在不产生虚假陈述的情况下进行欺骗,以及真伪探针是否无法检测此类行为。在三种开源 LLMs 上,我们展示了某些模型通过少量样本提示即可可靠地进行欺骗,尤其是生成误导性非虚假内容。进一步证明,基于标准真假数据集训练的真伪探针在检测说谎方面显著优于检测不说谎的欺骗行为,确认了当前机制欺骗检测方法的关键盲点。我们提议未来工作应将不说谎的对话情境下的欺骗纳入探针训练,并探索第二阶信念的表示,以更直接地针对欺骗概念的组成部分。
引用
@article{arxiv.2603.10003,
title = {Probing the Limits of the Lie Detector Approach to LLM Deception},
author = {Tom-Felix Berger},
journal= {arXiv preprint arXiv:2603.10003},
year = {2026}
}