基于梯度比率遮蔽的音频大语言模型效用感知型越狱攻击
声音
2026-04-13 v1 人工智能
摘要
音频大语言模型(ALLM)促进了丰富的语音-文本交互,但也在音频模态中引入了越狱漏洞。现有音频越狱方法主要关注成功率,忽略了效用保存,如转录质量和问答性能。在实际应用中,更强的攻击往往会导致效用下降。为研究这一权衡,我们通过变化频域中扰动覆盖范围,从部分频段到全频段,重新审视现有攻击方法,发现更广的频率覆盖并不一定提升越狱性能,同时效用持续恶化。这表明将扰动集中于子集频段可实现更好的攻击-效用权衡。基于此洞见,我们提出 GRM(Gradient-Ratio Masking),一种效用感知型频率选择越狱框架。它按 Mel 频段对攻击贡献与效用敏感性之比进行排序,仅扰动选定子集频段,并在语义保持目标下学习可复用的通用扰动。在四个代表性 ALLM 上实验显示,GRM 实现平均 88.46% 的越狱成功率(Jailbreak Success Rate, JSR),并在基线方法中提供更好的攻击-效用权衡。这些结果凸显了频率选择扰动在平衡音频越狱攻击效度与效用保存方面的潜力。内容警告:本文包含有害查询示例及不安全模型响应。
引用
@article{arxiv.2604.09222,
title = {GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking},
author = {Yunqiang Wang and Hengyuan Na and Di Wu and Miao Hu and Guocong Quan},
journal= {arXiv preprint arXiv:2604.09222},
year = {2026}
}
备注
Under Review