ARM系统:针对多模态模型的自适应红队测试代理与即插即用攻击
人工智能
2025-10-06 v1 机器学习
摘要
随着视觉语言模型(VLM)的流行,其多模态界面也引入了新的安全漏洞,这使得安全评估具有挑战性和重要性。现有的红队测试工作要么受限于狭窄的对抗模式,要么依赖大量手动工程,缺乏对新兴实际VLM漏洞的可扩展探索。为弥合这一差距,我们提出了ARMs系统,一种自适应红队测试代理,系统性地对VLM进行全面的风险评估。给定一个目标有害行为或风险定义,ARMs通过推理增强的多步骤编排,自动优化多样化的红队测试策略,以有效从目标VLM中诱发有害输出。我们提出了11种新颖的多模态攻击策略,涵盖VLM的多样化对抗模式(例如,推理劫持、情境隐蔽),并通过模型上下文协议(MCP)将17种红队测试算法集成到ARMs系统中。为平衡攻击的多样性与有效性,我们设计了分层记忆结构,并引入ε-贪婪攻击探索算法。大量实验在实例级和策略级基准测试上表明,ARMs系统在攻击成功率方面达到SOTA,平均提升52.1%,在Claude-4-Sonnet上超过90%。我们展示了ARMs生成的红队测试实例多样性显著高于基线方法,揭示了VLM中的新兴漏洞。利用ARMs系统,我们构建了ARMs-Bench数据集,包含30K以上红队测试实例,覆盖51种多样化风险类别,基于真实的多模态威胁和监管风险。使用ARMs-Bench进行安全微调,显著提升了VLM的鲁棒性,同时保持其通用实用性,为改善多模态安全对齐提供了可操作的指导,应对新兴威胁。
引用
@article{arxiv.2510.02677,
title = {ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks},
author = {Zhaorun Chen and Xun Liu and Mintong Kang and Jiawei Zhang and Minzhou Pan and Shuang Yang and Bo Li},
journal= {arXiv preprint arXiv:2510.02677},
year = {2025}
}
备注
60 pages, 16 figures