SPIRIT:针对越狱攻击修补语音语言模型
音频与语音处理
2025-10-17 v2 机器学习
摘要
语音语言模型(Speech Language Models, SLMs)通过语音指令实现自然交互,能够通过检测语音中的细微差别更有效地捕捉用户意图。与基于文本的模型相比,更丰富的语音信号引入了新的安全风险,由于对手可以通过注入不可察觉的语音噪声来更好地规避安全机制。我们分析了对抗性攻击,发现语音语言模型对越狱攻击更容易受到攻击,在某些情况下可实现完美的 100% 攻击成功率。为提高安全性,我们提出了后处理修补防御措施,在推理过程中通过修改语音语言模型的激活值来提高鲁棒性,可达 99%,且(i)对实用性几乎没有影响,(ii)无需任何重新训练。我们进行了消融研究,以最大化防御措施的有效性并改善实用性/安全性之间的权衡,在独特于语音语言模型的大规模基准测试中进行了验证。
引用
@article{arxiv.2505.13541,
title = {SPIRIT: Patching Speech Language Models against Jailbreak Attacks},
author = {Amirbek Djanibekov and Nurdaulet Mukhituly and Kentaro Inui and Hanan Aldarmaki and Nils Lukas},
journal= {arXiv preprint arXiv:2505.13541},
year = {2025}
}