GPT-4 过于聪明而不安全:通过密码与 LLM 进行隐蔽聊天
计算与语言
2024-03-27 v2
摘要
安全性处于大语言模型(LLM)开发的核心。已有大量工作致力于将 LLM 与人类伦理及偏好对齐,包括预训练中的数据过滤、监督微调、基于人类反馈的强化学习以及红队测试等。在本研究中,我们发现以密码进行的聊天可绕过 LLM 的安全对齐技术,而这些技术主要在自然语言上实施。我们提出一种新颖框架 CipherChat,以系统性检验安全对齐对非自然语言——密码的泛化能力。CipherChat 使人能够通过叠加系统角色描述与少量样本加密示例的密码提示与 LLM 聊天。我们使用 CipherChat 评估最先进的 LLM,包括 ChatGPT 与 GPT-4,在英汉两种语言下跨越 11 个安全领域的不同代表性人类密码。实验结果表明,某些密码在多个安全领域几乎 100% 成功地绕过 GPT-4 的安全对齐,表明有必要为非自然语言开发安全对齐。值得注意的是,我们识别出 LLM 似乎拥有一种“秘密密码”,并提出一种新颖的 SelfCipher,仅使用角色扮演与自然语言中的若干示例来激发该能力。SelfCipher 在几乎所有情形下均优于现有人类密码。我们的代码与数据将发布于 https://github.com/RobustNLP/CipherChat。
关键词
引用
@article{arxiv.2308.06463,
title = {GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher},
author = {Youliang Yuan and Wenxiang Jiao and Wenxuan Wang and Jen-tse Huang and Pinjia He and Shuming Shi and Zhaopeng Tu},
journal= {arXiv preprint arXiv:2308.06463},
year = {2024}
}
备注
Accepted by ICLR 2024. 21 pages, 3 figures, 13 tables