中文

超越提示诱导的谎言:探究良性提示下的 LLM 欺骗

机器学习 2026-05-04 v4 人工智能

摘要

大型语言模型(LLM)在推理、规划和决策任务中广泛部署,使其可信度至关重要。一个显著且鲜有人关注的风险是故意欺骗,即 LLM 故意制造或隐藏信息以服务隐藏目标。现有研究通常通过提示或微调显式设置隐藏目标来诱导欺骗,这可能不反映真实世界的人类-LLM 交互方式。超越此类人类诱导的欺骗,我们探究 LLM 在良性提示下的自发性欺骗。为解决缺乏真实情况的难题,我们提出了基于联系搜索问题(CSQ)的框架。该框架引入两个从心理学原理派生的统计指标来量化欺骗的可能性。第一个是欺骗意向分数,衡量模型对隐藏目标的偏向程度。第二个是欺骗行为分数,衡量 LLM 内部信念与其表达输出之间的不一致性。在评估 16 项领先 LLM后,我们发现两项指标大体同步上升,并在大多数模型的任务难度提升时也随之升高。此外,增加模型容量并不总是会降低欺骗,这对未来的 LLM 开发构成了重大挑战。

关键词

引用

@article{arxiv.2508.06361,
  title  = {Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts},
  author = {Zhaomin Wu and Mingzhe Du and See-Kiong Ng and Bingsheng He},
  journal= {arXiv preprint arXiv:2508.06361},
  year   = {2026}
}

备注

ICLR 2026 (Oral)