大型音频语言模型中的音频越狱:分类、攻防分析与成本感知评估
声音
2026-05-29 v1 人工智能
计算与语言
摘要
大型音频语言模型(LALMs)将越狱风险从 token 级别的提示扩展到完整的语音感知到推理管道,通过语义、声学风格、信号瑕疵或内部表示诱导不安全行为。现有工作在异构的威胁模型和评估协议下研究这些风险,难以比较攻击的实际性或防御的实用性。本文提供了统一的分类体系和受控的经验性评估,用于评估 LALM 攻击与防御。我们将已有工作组织为语义攻击、声学攻击、信号攻击和嵌入层攻击;防御分为基于守卫的、无训练的和基于训练的防御;以及跨模态、音频原生和交互式基准。随后我们在十个开源 LALMs 上评估代表性攻击与防御,不仅衡量攻击成功率,还衡量良性拒绝率和延迟。我们的结果表明,Acoustic Best-of-N 揭示了强大的音频空间脆弱性,Narrative Framing 是一种有效的低延迟语义威胁,而当前防御在鲁棒性与良性可用性之间进行权衡。这些发现支持成本和效用感知的评估,作为成功率唯一标准的 LALM 安全基准的必要补充。
引用
@article{arxiv.2605.30031,
title = {Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation},
author = {Bo-Han Feng and Yu-Hsuan Li Liang and Chien-Feng Liu and You-Hsuan Chang and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2605.30031},
year = {2026}
}
备注
Submitted to ACL ARR 2026 May