仅攻击编码器即可破坏音频大语言模型:一种通用的定向潜空间音频攻击
声音
2026-01-01 v1 人工智能
密码学与安全
摘要
音频语言模型将音频编码器与大语言模型相结合以实现多模态推理,但它们也引入了新的安全漏洞。我们提出了一种通用的定向潜空间攻击,这是一种编码器级的对抗攻击,通过操纵音频潜表示来诱导下游语言生成中产生攻击者指定的输出。与先前的波形级或特定输入攻击不同,我们的方法学习了一种通用扰动,能够跨输入和说话人泛化,且不需要访问语言模型。在Qwen2-Audio-7B-Instruct上的实验表明,该攻击在极小的感知失真下始终保持较高的攻击成功率,揭示了多模态系统编码器级一个关键且此前未被充分探索的攻击面。
引用
@article{arxiv.2512.23881,
title = {Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack},
author = {Roee Ziv and Raz Lapid and Moshe Sipper},
journal= {arXiv preprint arXiv:2512.23881},
year = {2026}
}