条件解码实现的鲁棒多模态安全
机器学习
2026-04-02 v1 人工智能
摘要
多模态大型语言模型(MLLM)在面对利用跨模态交互的有害查询时,常常出现安全对齐性能下降。仅基于文本对齐的模型在扩展至两种以上模态后,成功攻击率更高。在本工作中,我们提出了一种简单的数据条件解码策略,CASA(Classification Augmented with Safety Attention),该策略利用 MLLM 的内部表示预测二元安全标记,以增强模型检测恶意查询的能力。我们引入了新颖的安全注意力模块,以提升模型识别恶意查询的能力。我们的设计无需依赖任何外部分类器或辅助头,无需针对各模态进行特定的安全微调。在 diverse 的基准测试(如 MM-SafetyBench、JailbreakV-28k 和对抗性音频测试)上,CASA 在各模态和各攻击类型下将平均攻击成功率降低超过 97%。我们的实证评估还显示,CASA 在良性输入下保持强大的实用性,经由自动化和人类评估(通过 13 名培训标注员)验证。这些结果突显了 CASA 作为改进多模态 LLM 安全的简单且通用框架。
引用
@article{arxiv.2604.00310,
title = {Robust Multimodal Safety via Conditional Decoding},
author = {Anurag Kumar and Raghuveer Peri and Jon Burnsky and Alexandru Nelus and Rohit Paturi and Srikanth Vishnubhotla and Yanjun Qi},
journal= {arXiv preprint arXiv:2604.00310},
year = {2026}
}
备注
8 pages + Appendix section. Submitted to ACL 2026