中文

Rebellion:面向音频推理模型的噪声鲁棒推理训练

人工智能 2025-11-14 v1 声音

摘要

通过推理训练(RT)为大型模型(LMs)灌输推理能力可显著提升 LMs 的性能。因此,能够进行推理的音频模型(ARMs),即能够进行推理的音频 LMs,正日益受到关注。然而,尚无工作研究 ARMS 针对旨在激发目标模型有害响应的越狱攻击的安全性。为此,我们首先表明,标准 RT 结合适当的安全推理数据可保护 ARMS 免受基础音频越狱攻击的攻击,但无法保护 ARMS 免受我们提出的简单而有效的越狱攻击的攻击。我们进一步表明,这是由于 vanilla 与高级越狱之间存在显著的表示漂移,导致目标 ARMS 发射有害响应。基于此观察,我们提出 Rebellion,一种鲁棒的 RT,用于训练 ARMS 应对最坏情况的表示漂移。所有结果均基于 Qwen2-Audio;它们表明 Rebellion:1) 可在不损害良性任务性能的前提下保护免受高级音频越狱攻击,以及2) 在标准 RT 方法的准下显著改善准确性-安全性权衡。

关键词

引用

@article{arxiv.2511.09682,
  title  = {Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models},
  author = {Tiansheng Huang and Virat Shejwalkar and Oscar Chang and Milad Nasr and Ling Liu},
  journal= {arXiv preprint arXiv:2511.09682},
  year   = {2025}
}