中文

音频乃阿喀琉斯之踵:红队测试音频大型多模态模型

计算与语言 2024-11-01 v1 多媒体 声音 音频与语音处理

摘要

大型多模态模型(LMMs)通过结合大型语言模型(LLMs)与模态编码器,将多模态信息(视觉和听觉)与文本对齐,展示了在真实世界条件下与人类交互的能力。然而,此类模型带来了新的安全挑战:在文本上进行了安全对齐的模型,是否也能对多模态输入表现出同样一致的防护措施?尽管近期已有针对视觉LMMs的安全对齐研究,但音频LMMs的安全性仍未得到充分探索。在这项工作中,我们在三种设置下对五个先进的音频LMMs进行了全面的红队安全测试:(i) 音频和文本格式的有害问题,(ii) 伴有分散注意力的非语音音频的文本格式有害问题,以及 (iii) 语音特定的越狱攻击。我们在这些设置下的结果表明,开源音频LMMs在有害音频问题上遭受的平均攻击成功率为69.14%,并且在被非语音音频噪声分散注意力时表现出安全漏洞。我们针对Gemini-1.5-Pro的语音特定越狱攻击在有害查询基准上实现了70.67%的攻击成功率。我们提供了关于可能导致这些已报告的安全不一致性原因的见解。警告:本文包含攻击性示例。

关键词

引用

@article{arxiv.2410.23861,
  title  = {Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models},
  author = {Hao Yang and Lizhen Qu and Ehsan Shareghi and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2410.23861},
  year   = {2024}
}