音频 LLM 的多语言和多方言入侵
声音
2025-04-03 v1 人工智能
计算与语言
密码学与安全
音频与语音处理
摘要
大型音频语言模型 (LALM) 已显著推进了音频理解,但也引入了关键安全风险,尤其是通过音频入侵。尽管先前的工作聚焦于以英语为中心的攻击,但我们暴露了更严重的漏洞:对抗性多语言和多方言音频入侵,其中语言和声学变化显著放大了攻击成功率。在本文中,我们引入了 Multi-AudioJail,这是一个系统性框架,用于利用这些漏洞:(1)构建一个对抗性扰动的多语言/多方言音频入侵提示数据集;(2)分层评估管道揭示声学扰动(例如混响、回声和低语效果)如何与跨语言语音相互作用,导致攻击成功率提高最高可达 +57.25 个百分点(例如,对 MERaLiON 的混响肯尼亚方言攻击)。关键的是,我们进一步揭示了多模态 LLM 本身更容易受到攻击:攻击者只需利用最弱的环节(例如非英语音频输入)即可 compromise entire model,我们通过多语言音频-only 攻击实现了文本-only 攻击的 3.1 倍成功率。我们计划在本论文发表后公开发布数据集,以激励社区为跨模态防御研究,呼吁社区在 LALM 发展的同时关注这种在多模态性中不断扩大的攻击面。
引用
@article{arxiv.2504.01094,
title = {Multilingual and Multi-Accent Jailbreaking of Audio LLMs},
author = {Jaechul Roh and Virat Shejwalkar and Amir Houmansadr},
journal= {arXiv preprint arXiv:2504.01094},
year = {2025}
}
备注
21 pages, 6 figures, 15 tables