说谎者台阶:评估语言模型谎言检测器
计算与语言
2026-01-12 v2 人工智能
摘要
先前的工作已引入用于检测大语言模型(LLM)说谎的技术,即生成其认为错误的陈述。然而,这些技术通常在不捕捉LLM可生成的多样化谎言的狭窄设置中进行验证。我们引入LIARS' BENCH(说谎者台阶),这是一个包含72,863个说谎与诚实回应示例的测试库,这些示例由四个开源权重模型在七个数据集上生成。我们的设置捕捉了不同类型的谎言,并沿两个维度进行变化:模型说谎的原因以及谎言所针对的信念对象。对三个黑盒和白盒谎言检测技术在LIARS' BENCH上进行评估,我们发现现有技术在特定类型的谎言,尤其是在无法仅凭 transcript 确定模型是否说谎的情境下,系统性地未能识别。总体而言,LIARS' BENCH揭示了先前技术的局限性,并为指导谎言检测进展提供了实用测试平台。
引用
@article{arxiv.2511.16035,
title = {Liars' Bench: Evaluating Lie Detectors for Language Models},
author = {Kieron Kretschmar and Walter Laurito and Sharan Maiya and Samuel Marks},
journal= {arXiv preprint arXiv:2511.16035},
year = {2026}
}
备注
*Kieron Kretschmar and Walter Laurito contributed equally to this work. 10 pages, 2 figures; plus appendix. Code at https://github.com/Cadenza-Labs/liars-bench and datasets at https://huggingface.co/datasets/Cadenza-Labs/liars-bench Subjects: Computation and Language (cs.CL); Artificial Intelligence (cs.AI)