中文

登堂入室:从认知心理学视角理解大语言模型越狱

计算与语言 2024-02-27 v1 人工智能

摘要

大语言模型(LLMs)已逐渐成为人们获取新知识的门户。然而,攻击者可以突破模型的安全防护(“监狱”)以访问受限信息,这被称为“越狱”。先前的研究揭示了当前 LLMs 在面对此类越狱攻击时的弱点。尽管如此,对于 LLMs 在接收越狱提示时内在决策机制的理解仍然明显不足。我们的研究为越狱提示提供了心理学解释。借鉴认知一致性理论,我们认为越狱的关键在于引导 LLM 在错误的方向上实现认知协调。此外,我们提出了一种基于“登门槛”(Foot-in-the-Door, FITD)技术的自动黑盒越狱方法。该方法通过多步增量提示逐步诱导模型回答有害问题。我们实例化了一个原型系统,在 8 个先进的 LLMs 上评估了越狱效果,平均成功率达到 83.9%。本研究构建了一个心理学视角,为理解 LLMs 内在决策逻辑提供了阐释性见解。

关键词

引用

@article{arxiv.2402.15690,
  title  = {Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology},
  author = {Zhenhua Wang and Wei Xie and Baosheng Wang and Enze Wang and Zhiwen Gui and Shuoyoucheng Ma and Kai Chen},
  journal= {arXiv preprint arXiv:2402.15690},
  year   = {2024}
}