中文

TreeTeaming:基于层次策略探索的视觉语言模型自主红队测试

机器学习 2026-03-25 v1 计算机视觉与模式识别

摘要

视觉语言模型 (Vision-Language Models, VLM) 的快速发展使其安全漏洞受到密切关注。然而,现有红队测试方法受限于固有的线性探索范式,将其限制在预定义策略集合内进行优化,无法发现新颖且多样的漏洞。为突破这一限制,我们提出 TreeTeaming,一种自动化红队测试框架,将策略探索从静态测试重构为动态的演化发现过程。其核心是由大型语言模型 (LLM) 驱动的策略 Orchestrator,能够自主决定是演化有前景的攻击路径还是探索多样的战略分支,从而动态构建和扩大策略树。随后,多模态执行器被 tasked 执行这些复杂的策略。在 12 个知名 VLM 的实验中,TreeTeaming 在 11 个模型上实现最高的攻击成功率,最高可达 87.60%,超越现有方法。该框架还显示出对先前公开越狱策略的优异战略多样性。此外,生成的攻击平均降低 23.09% 的毒性,展现其隐蔽性和微妙性。我们的工作引入了自动化漏洞发现的新范式,强调超越静态启发式进行主动探索以确保前沿 AI 模型安全的必要性。

关键词

引用

@article{arxiv.2603.22882,
  title  = {TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration},
  author = {Chunxiao Li and Lijun Li and Jing Shao},
  journal= {arXiv preprint arXiv:2603.22882},
  year   = {2026}
}

备注

CVPR2026