中文

当好声音走向对抗:以良性输入劫持音频语言模型

声音 2026-02-05 v3 人工智能 密码学与安全 音频与语音处理

摘要

随着大型语言模型(LLM)越来越广泛地融入日常生活,音频已成为人机交互的关键接口。然而,这种便利性也带来了新的漏洞,使音频成为潜在的攻击面。我们的研究引入了 WhisperInject,一种两阶段的对抗音频攻击框架,通过操控先进的音频语言模型生成有害内容。我们的方法将有害载荷作为微小扰动嵌入音频输入中,这些扰动对人类听者而言仍然可理解。第一阶段使用一种新颖的基于奖励的白盒优化方法——联合抽样梯度下降(RL-PGD),以劫持目标模型并诱发有害的本机响应。此后,Stage 2 中的有效载荷注入则使用梯度优化方法将微小扰动嵌入良性音频载体中,如天气查询或问候消息。我们的方法在两个基准和五个多模态 LLM 上实现了 60-78% 的平均攻击成功率,经由多个评估框架验证。我们的工作揭示了一种新的实用音频原生威胁类别,超越理论性漏洞,显示出一种可行且隐蔽的方法,用于操控多模态 AI 系统。

关键词

引用

@article{arxiv.2508.03365,
  title  = {When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs},
  author = {Hiskias Dingeto and Taeyoun Kwon and Dasol Choi and Bodam Kim and DongGeon Lee and Haon Park and JaeHoon Lee and Jongho Shin},
  journal= {arXiv preprint arXiv:2508.03365},
  year   = {2026}
}