中文

听见我:面向大音频语言模型的音频叙事攻击

计算与语言 2026-02-02 v1 人工智能 密码学与安全

摘要

大型音频语言模型越来越多地处理原始语音输入,使其在语音助手、教育和临床分诊等领域的集成更加顺畅。然而,这一转变引入了一类尚未充分特征化的安全漏洞。我们通过设计一种将不允许的指令嵌入叙事风格音频流中的文本到音频jailbreak,来检视这一模态变迁的安全影响。该攻击利用先进的指令遵循文本到语音(TTS)模型,利用其结构和声学属性,从而规避主要针对文本校准的安全机制。当通过合成语音传递时,叙事格式会从包括 Gemini 2.0 Flash 在内的各类最先进模型中触发受限输出,实现 98.26% 的成功率,显著超过文本-only 基线。这些结果凸显了正如语音界面日益普及,需 jointly 推理语言和 paralinguistic 表示的安全框架的必要性。

关键词

引用

@article{arxiv.2601.23255,
  title  = {Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models},
  author = {Ye Yu and Haibo Jin and Yaoning Yu and Jun Zhuang and Haohan Wang},
  journal= {arXiv preprint arXiv:2601.23255},
  year   = {2026}
}

备注

to be published at EACL 2026 main conference