中文

SARSteer:通过安全剖析拒绝引导保护大型音频语言模型

声音 2026-05-08 v2 密码学与安全

摘要

大型音频语言模型 (LALM) 正变得越来越重要,作为面向实际应用的强大多模态 backbone。然而,近期研究表明,音频输入比文本更容易诱发有害响应,这在部署方面暴露了新的风险。尽管安全对齐在 LLM 和大型视觉语言模型 (LVM) 中取得了初步进展,但我们发现将这些方法直接应用于 LALM 面临两个关键局限:1) 基于 LLM 的引导在音频输入下会失败,因为激活之间存在巨大的分布差异;2) 基于提示的防御会导致对良好语音查询的过度拒绝。为解决这些挑战,我们提出了安全剖析拒绝引导 (SARSteer),这是 LALM 首个推理时防御框架。具体而言,SARSteer 利用文本派生的拒绝引导来执行拒绝,而不修改音频输入,并引入分解安全空间消除以缓解过度拒绝。广泛的实验表明,SARSteer 在拒绝有害查询方面显著提升,同时保留了对良好响应的能力,为 LALM 的安全对齐奠定了原则性步骤。该项目的源码和构建的数据集已发布于 https://github.com/linweiii/SARSteer。

关键词

引用

@article{arxiv.2510.17633,
  title  = {SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering},
  author = {Weilin Lin and Jianze Li and Hui Xiong and Li Liu},
  journal= {arXiv preprint arXiv:2510.17633},
  year   = {2026}
}