中文

Jailbreak-AudioBench:对大型音频语言模型的越狱威胁的深入评估与分析

声音 2026-01-13 v4 人工智能 机器学习 多媒体 音频与语音处理

摘要

大型语言模型 (LLM) 在广泛的自然语言处理任务中展现出惊人的零样本性能。将各种模态编码器集成进一步扩展了其能力,催生了能够处理文本之外的视觉和听觉模态输入的多模态大型语言模型 (MLLM)。然而,这些先进的能力也可能引发显著的安全问题,因为模型可被利用通过越狱攻击生成有害或不当内容。虽然先前的工作广泛探索了如何通过操控文本或视觉模态输入来规避 LLM 和 MLLM 中的安全措施,但大型音频语言模型 (LALM) 上针对音频特定越狱的漏洞仍基本未被探讨。为填补这一空白,我们引入 Jailbreak-AudioBench,包含工具箱、精选数据集和全面基准测试。该工具箱不仅支持文本转音频转换,还支持各种编辑技术用于注入音频隐藏语义。精选数据集提供了多样化的显式和隐式越狱音频示例,包括原始和编辑后的形式。利用该数据集,我们评估了多个最先进的 LALM,并建立了目前为止最全面的音频模态越狱基准测试。最终,Jailbreak-AudioBench 为推动 LALM 安全对齐的未来研究提供了基础,通过揭示更强大的越狱威胁(如基于查询的音频编辑),并促进有效防御机制的开发。

关键词

引用

@article{arxiv.2501.13772,
  title  = {Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models},
  author = {Hao Cheng and Erjia Xiao and Jing Shao and Yichi Wang and Le Yang and Chao Shen and Philip Torr and Jindong Gu and Renjing Xu},
  journal= {arXiv preprint arXiv:2501.13772},
  year   = {2026}
}