针对大型音频语言模型的 AdvWave:一种隐形对抗越狱攻击
声音
2024-12-12 v1 人工智能
密码学与安全
音频与语音处理
摘要
最近的进展使大型音频语言模型(LALMs)能够实现语音交互,显著提升用户体验并加速LALMs在实际应用中的部署。然而,确保LALMs的安全性至关重要,以防止引发社会关切或违反AI法规的风险输出。尽管重要性一线,针对LALMs的越狱研究仍有限,由于其近期涌现并面临额外技术挑战。具体而言,LALMs中的音频编码器涉及离散化运算,常导致梯度消散,阻碍基于梯度的优化攻击。LALMs的行为变异性进一步复杂化了对有效(对抗)优化目标的识别。此外,对对抗音频施加隐形约束会导致可行解空间受限且非凸,进一步加剧优化过程的挑战。为克服这些挑战,我们开发了AdvWave,即第一个针对LALMs的越狱框架。我们提出了双相优化方法,解决梯度消散问题,实现有效的端到端梯度优化。此外,我们开发了自适应对抗目标搜索算法,根据LALMs对特定查询的响应模式动态调整对抗优化目标。为确保对抗音频对人类听者保持自然感知,我们设计了基于分类器的优化方法,生成类似常见城市声音的对抗噪声。在多个先进LALMs上的广泛评估表明,AdvWave超越基线方法,实现平均越狱攻击成功率提升40%。
引用
@article{arxiv.2412.08608,
title = {AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models},
author = {Mintong Kang and Chejian Xu and Bo Li},
journal= {arXiv preprint arXiv:2412.08608},
year = {2024}
}