中文

Speech-Audio 组合攻击对多模态 LLM 及其通过 SALMONN-Guard 的缓解

声音 2026-02-12 v3 人工智能

摘要

近期 LLM 进展使其能够理解音频信号, 但也暴露了由于复杂音频输入而当前安全措施不足的新型风险. 我们引入 SACRED-Bench(Speech-Audio Composition for RED-teaming)以评估 LLM 在复杂音频攻击下的鲁棒性. 与现有基于扰动的方法(依赖噪声优化或白盒访问)不同, SACRED-Bench 利用语音-音频组合实现有效的黑盒攻击. SACRED-Bench 采用三种组合机制: (a) 有害语音与良性语音的重叠, (b) 良性语音与有害非语音音频的混合, (c) 多说话人对话. 这些机制聚焦于评估良性与有害意图在单个听觉场景中共存的安全性. 此外, SACRED-Bench 中的问题旨在隐式引用音频内容, 使得文本提示本身不包含明确的有害信息. 实验表明, 即使是启用了完整安全防护的领先专有 LLM Gemini 2.5 Pro, 仍存在 66% 的攻击成功率. 为弥合这一差距, 我们提出 SALMONN-Guard, 第一个同时检查语音、音频和文本的 guard 模型, 将攻击成功率降低至 20%. 我们的结果凸显了为确保多模态 LLM 安全所需的音频感知防御. 数据集和 SALMONN-Guard 检查点可在 https://huggingface.co/datasets/tsinghua-ee/SACRED-Bench 查找.

关键词

引用

@article{arxiv.2511.10222,
  title  = {Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard},
  author = {Yudong Yang and Xuezhen Zhang and Zhifeng Han and Siyin Wang and Jimin Zhuang and Zengrui Jin and Jing Shao and Guangzhi Sun and Chao Zhang},
  journal= {arXiv preprint arXiv:2511.10222},
  year   = {2026}
}