当思考的 LLM 说谎:揭示推理模型中的策略性欺骗
人工智能
2025-06-06 v1 计算与语言
密码学与安全
机器学习
摘要
大型语言模型(LLM)的诚实性是关键的对齐挑战,特别是当具有链式思维(CoT)推理的高级系统可能对人类进行策略性欺骗时。与传统 LLM 的诚实问题不同,这些模型的显式思维路径使我们能够研究策略性欺骗——即以目标为导向的有意误导,其中推理与输出相矛盾。通过表示工程,我们系统性地诱导、检测并控制这些欺骗行为,从而通过线性人工断层(LAT)提取“欺骗向量”,实现 89% 的检测准确率。通过激活引导,我们实现了 40% 的成功率,能够在不明确提示的情况下引发情境适应的欺骗,揭示了推理模型的具体诚实性问题,并为可信赖的 AI 对齐提供工具。
引用
@article{arxiv.2506.04909,
title = {When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models},
author = {Kai Wang and Yihao Zhang and Meng Sun},
journal= {arXiv preprint arXiv:2506.04909},
year = {2025}
}