声学干扰:将声学潜在语义武器化以对大型音频语言模型实施通用越狱的新范式
密码学与安全
2026-05-19 v1 声音
摘要
将音频模态集成到大型音频语言模型(LALM)中显著扩大了其攻击面。现有的越狱范式主要将音频视为恶意载荷的载体,依赖语义优化、声学参数控制或加性扰动将有害内容嵌入音频信号中。在本研究中,我们对这一必要性提出质疑,并提出一种新范式,其中音频的作用从内容注入转变为安全对齐干扰。我们发现,LALM 的安全对齐可以仅被特定的声学潜在语义(ALS)破坏,这些语义是音频生成模型先验中固有的底层副语言特征。与以往利用显式声学参数仅仅改变恶意音频风格的工作不同,我们证明了内容良性但注入了特定 ALS 的干扰音频可以作为通用的越狱触发器。利用这一发现,我们提出了声学干扰攻击(AIA),它将攻击载荷与音频解耦。具体而言,AIA 采用一组通用的、指令中立的干扰音频,使标准恶意文本查询能够绕过安全对齐,而无需针对特定实例进行优化。在五个数据集上对 10 个 LALM 进行的广泛实验表明,AIA 实现了最先进的攻击成功率。此外,我们的可解释性分析揭示了 AIA 引起的推理路径漂移,并识别了 ALS 内在的有效模式,揭示了 LALM 中跨模态对齐的基本脆弱性。
引用
@article{arxiv.2605.18168,
title = {Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models},
author = {Yanyun Wang and Yu Huang and Zi Liang and Xixin Wu and Li Liu},
journal= {arXiv preprint arXiv:2605.18168},
year = {2026}
}
备注
43rd International Conference on Machine Learning (ICML'26)