系统消息在大语言模型中的越狱攻击中真的重要吗?
计算与语言
2024-06-21 v2 人工智能
密码学与安全
摘要
大语言模型(LLMs)的快速发展使其成为现代社会中不可或缺的工具。虽然安全措施通常在发布前将LLMs对齐人类价值观,但近期研究揭示了一种令人担忧的现象,称为“越狱”。该术语指的是LLMs在针对恶意问题提出提示时,生成意外且可能有害的响应。目前大多数研究聚焦于生成越狱提示,但系统消息的配置在实验中差异很大。本文旨在回答一个问题:系统消息对LLMs中的越狱攻击真的重要吗?我们针对主流LLMs进行实验,通过变更系统消息的长短以及是否设置来生成越狱提示。我们发现,不同的系统消息对抗越狱攻击的效果各不相同。因此,我们进一步探讨了在不同系统消息下的越狱攻击的可迁移性。此外,我们提出了“系统消息进化算法”(SMEA),以生成对越狱提示更具抗性的系统消息,即使对系统消息的长度进行微小更改也能保持其防御能力。通过SMEA,我们获得了在系统消息长度几乎不变的情况下,具有较强鲁棒性的系统消息群。我们的研究不仅加强了LLMs的安全性,也提升了越狱攻击的门槛,推动了该领域研究的进步。
引用
@article{arxiv.2402.14857,
title = {Is the System Message Really Important to Jailbreaks in Large Language Models?},
author = {Xiaotian Zou and Yongkang Chen and Ke Li},
journal= {arXiv preprint arXiv:2402.14857},
year = {2024}
}
备注
13 pages,3 figures