Rebellion:面向音频推理模型的噪声鲁棒推理训练
人工智能
2025-11-14 v1 声音
摘要
通过推理训练(RT)为大型模型(LMs)灌输推理能力可显著提升 LMs 的性能。因此,能够进行推理的音频模型(ARMs),即能够进行推理的音频 LMs,正日益受到关注。然而,尚无工作研究 ARMS 针对旨在激发目标模型有害响应的越狱攻击的安全性。为此,我们首先表明,标准 RT 结合适当的安全推理数据可保护 ARMS 免受基础音频越狱攻击的攻击,但无法保护 ARMS 免受我们提出的简单而有效的越狱攻击的攻击。我们进一步表明,这是由于 vanilla 与高级越狱之间存在显著的表示漂移,导致目标 ARMS 发射有害响应。基于此观察,我们提出 Rebellion,一种鲁棒的 RT,用于训练 ARMS 应对最坏情况的表示漂移。所有结果均基于 Qwen2-Audio;它们表明 Rebellion:1) 可在不损害良性任务性能的前提下保护免受高级音频越狱攻击,以及2) 在标准 RT 方法的准下显著改善准确性-安全性权衡。
引用
@article{arxiv.2511.09682,
title = {Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models},
author = {Tiansheng Huang and Virat Shejwalkar and Oscar Chang and Milad Nasr and Ling Liu},
journal= {arXiv preprint arXiv:2511.09682},
year = {2025}
}