针对GPT-4o的语音越狱攻击
密码学与安全
2024-05-30 v1 机器学习
摘要
最近,人工智能助手的概念已从科幻小说演变为现实应用。GPT-4o作为最新的跨音频、视觉和文本的多模态大语言模型,通过实现更自然的人机交互,进一步模糊了虚构与现实之间的界限。然而,GPT-4o语音模式的出现也可能引入新的攻击面。在本文中,我们首次系统性地测量了针对GPT-4o语音模式的越狱攻击。我们表明,当直接将禁止问题和文本越狱提示转移到语音模式时,GPT-4o表现出良好的抵抗能力。这种抵抗主要归因于GPT-4o的内部安全机制以及将文本越狱提示适配到语音模式的困难。受GPT-4o类人行为的启发,我们提出了VoiceJailbreak,一种新颖的语音越狱攻击,它人性化GPT-4o并试图通过虚构故事叙述(设定、角色和情节)来说服它。VoiceJailbreak能够生成简单、可听且有效的越狱提示,在六种禁止场景下将平均攻击成功率从0.033显著提高到0.778。我们还进行了大量实验,探讨交互步骤、虚构写作的关键元素以及不同语言对VoiceJailbreak有效性的影响,并通过高级虚构写作技术进一步增强攻击性能。我们希望我们的研究能够帮助研究社区构建更安全、更规范的多模态大语言模型。
引用
@article{arxiv.2405.19103,
title = {Voice Jailbreak Attacks Against GPT-4o},
author = {Xinyue Shen and Yixin Wu and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2405.19103},
year = {2024}
}