中文

音频越狱:用于攻击大型音频语言模型的开放综合基准

声音 2025-05-22 v1 人工智能 音频与语音处理

摘要

大型音频语言模型(LAM)的兴起带来了潜力与风险,其音频输出可能包含有害或不道德的内容。然而,当前研究缺乏针对LAM安全性,尤其是针对越狱攻击的系统性、量化评估,这些攻击因语音的时序与语义特性而具备挑战性。为弥合这一差距,我们引入AJailBench,首个专为评估LAM越狱漏洞而设计的基准。我们首先构建AJailBench-Base,包含1,495个覆盖10个政策违规类别的对抗音频提示,通过真实的文本到语音合成从文本化身迁移。使用该数据集,我们评估了多个最先进的LAM,发现其均未在攻击中表现出一致的鲁性。为进一步加强越狱测试并模拟更真实的攻击条件,我们提出生成动态对抗变体的方法。我们的音频扰动工具包(APT)在时、频、幅度域应用定向扰动。为保持原始越狱意图,我们施加语义一致性约束,并采用贝叶斯优化高效搜索能够同时轻微且高度有效的扰动。这导致AJailBench-APT,一个优化后的对抗音频样本的扩展数据集。我们的发现表明,即使是小幅、语义保持的扰动也能显著降低领先LAM的安全性能,这凸显了需要更健壮且语义感知的防御机制的重要性。

关键词

引用

@article{arxiv.2505.15406,
  title  = {Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models},
  author = {Zirui Song and Qian Jiang and Mingxuan Cui and Mingzhe Li and Lang Gao and Zeyu Zhang and Zixiang Xu and Yanbo Wang and Chenxi Wang and Guangxian Ouyang and Zhenhao Chen and Xiuying Chen},
  journal= {arXiv preprint arXiv:2505.15406},
  year   = {2025}
}

备注

We release AJailBench, including both static and optimized adversarial data, to facilitate future research: https://github.com/mbzuai-nlp/AudioJailbreak