大型音频语言模型对音频注入鲁棒性的评估:一项实证研究
计算与语言
2025-07-11 v2
摘要
大型音频语言模型日益部署于实际应用中,然而其针对恶意音频注入攻击的鲁棒性仍未得到充分探索。本研究系统评估了五个领先的 LALM 在四种攻击场景下的表现:音频干扰攻击、指令遵循攻击、上下文注入攻击和判断劫持攻击。使用防御成功率、上下文鲁棒性评分和判断鲁棒性指数等指标,对其脆弱性与抗性进行了定量评估。实验结果揭示了模型之间存在显著的性能差异;没有单一模型能够在所有攻击类型上持续优于其他模型。恶意内容的位置严重影响攻击有效性,尤其是当其位于序列开头时。指令遵循能力与鲁棒性之间的负相关性表明,严格遵守指令的模型可能更容易受到攻击,而经过安全对齐的模型则表现出更强的抵抗力。此外,系统提示的有效性不一,表明需要量身定制的策略。本工作引入了一个基准框架,并强调了将鲁棒性纳入训练流水线的重要性。研究结果强调,应开发多模态防御与解耦能力与易受攻击性的架构设计,以实现 LALM 的安全部署。
引用
@article{arxiv.2505.19598,
title = {Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study},
author = {Guanyu Hou and Jiaming He and Yinhang Zhou and Ji Guo and Yitong Qiao and Rui Zhang and Wenbo Jiang},
journal= {arXiv preprint arXiv:2505.19598},
year = {2025}
}