中文

化身博士与海德先生:大语言模型的两面性

密码学与安全 2026-05-01 v7 机器学习

摘要

大语言模型(LLMs)正被集成到诸如聊天机器人或电子邮件助手等应用中。为了防止不当回复,它们内部实现了安全机制,例如基于人类反馈的强化学习(RLHF)。在本研究中,我们通过让 ChatGPT、Gemini 和 Deepseek 扮演具有与诚实助手不一致的人格特征的复杂角色,绕过了这些安全措施。首先,我们创建这些角色的详细传记,然后我们在与相同聊天机器人的新会话中使用它们。我们的对话随后遵循角色扮演风格以引出被禁止的回复。利用角色设定,我们展示了聊天机器人会提供被禁止的回复,使得在查询 ChatGPT、Gemini 和 Deepseek 时获取未经授权、非法或有害信息成为可能。我们展示了这些聊天机器人容易受到此类攻击,在 GPT-4.1-mini 中 40 个非法问题中有 40 个获得了危险信息,在 GPT-4o-mini 中为 40 个中的 39 个,在 GPT-3.5-turbo 中为 40 个中的 38 个,以及在 Gemini-2.5-flash 和 DeepSeek V3 中各 2 个案例中的 2 个。该攻击可以手动执行,也可以使用辅助 LLM 自动执行,并且已被证明对 2023 年至 2025 年间部署的模型有效。

关键词

引用

@article{arxiv.2312.03853,
  title  = {Dr. Jekyll and Mr. Hyde: Two Faces of LLMs},
  author = {Matteo Gioele Collu and Tom Janssen-Groesbeek and Stefanos Koffas and Mauro Conti and Stjepan Picek},
  journal= {arXiv preprint arXiv:2312.03853},
  year   = {2026}
}

备注

Presented at the Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), Cagliari, Italy, February 09-13, 2026. Published as Paper 35 in CEUR Workshop Proceedings, Vol-4198. Available at: https://ceur-ws.org/Vol-4198/