StyleBreak:通过风格感知音频越狱揭示大型音频语言模型中的对齐漏洞
声音
2025-11-17 v1
摘要
大型音频语言模型(LAMs)最近通过将音频编码器与大型语言模型(LLM)耦合,实现了强大的语音交互能力。然而,LAMs 在对抗攻击下的安全性尚未得到充分探讨,尤其是通过音频越狱制造恶意音频提示以绕过对齐机制。现有工作主要依赖将基于文本的攻击转化为语音或应用浅层信号级扰动,忽略了人类语音表达性变化对LAMs对齐鲁棒性的影响。为此,我们提出StyleBreak,一种新颖的风格感知音频越狱框架,系统性地研究多样化人类语音属性如何影响LAMs对齐鲁棒性。具体而言,StyleBreak采用两阶段风格感知转换管线,对文本内容和音频进行扰动,以控制语言、副语言和外语言属性。此外,我们开发了查询自适应策略网络,自动搜索对抗性风格,以提高LAMs越狱探索的效率。广泛的评估表明,LAMs在面对多样化人类语音属性时表现出关键漏洞。此外,StyleBreak在多种攻击范式下显著提升了攻击效果和效率,凸显了需要为LAMs构建更健壮对齐机制的紧迫性。
引用
@article{arxiv.2511.10692,
title = {StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak},
author = {Hongyi Li and Chengxuan Zhou and Chu Wang and Sicheng Liang and Yanting Chen and Qinlin Xie and Jiawei Ye and Jie Wu},
journal= {arXiv preprint arXiv:2511.10692},
year = {2025}
}
备注
Accepted by AAAI 2026