如何抓住AI说谎者:通过询问不相关问题检测黑盒LLM中的谎言
计算与语言
2023-09-28 v1 人工智能
机器学习
摘要
大语言模型(LLMs)可能会“说谎”,我们将其定义为尽管以可证明的意义“知道”真相却输出虚假陈述。例如,当被指示输出错误信息时,LLMs可能会“说谎”。在此,我们开发了一种简单的谎言检测器,既不需要访问LLM的激活(黑盒),也不需要相关事实的 ground-truth 知识。该检测器通过在疑似谎言后询问一组预定义的不相关后续问题,并将LLM的是/否回答输入逻辑回归分类器来工作。尽管简单,该谎言检测器高度准确且出奇地通用。当在单一设置下训练——提示GPT-3.5对事实问题说谎——该检测器可分布外泛化到(1)其他LLM架构,(2)微调至说谎的LLMs,(3)谄媚性谎言,以及(4)现实场景(如销售)中出现的谎言。这些结果表明,LLMs具有独特的与谎言相关的行为模式,跨架构和上下文一致,这可能实现通用目的的谎言检测。
引用
@article{arxiv.2309.15840,
title = {How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions},
author = {Lorenzo Pacchiardi and Alex J. Chan and Sören Mindermann and Ilan Moscovitz and Alexa Y. Pan and Yarin Gal and Owain Evans and Jan Brauner},
journal= {arXiv preprint arXiv:2309.15840},
year = {2023}
}