安全围观战(SecTOW):基于强化学习的迭代防御-攻击训练用于多模态模型安全
密码学与安全
2025-07-30 v1 人工智能
摘要
多模态大语言模型(MLLMs)的快速发展推动了多个应用领域的突破,但其安全性仍是一个关键挑战。一个迫切的问题是存在不安全的图像-查询对——即特意设计的越狱输入,用以绕过安全约束并诱发MLLMs产生意外响应。与通用多模态数据相比,这些不安全输入相对稀疏,这限制了开发稳健防御模型时训练样本的多样性和丰富性。与此同时,现有的围栏类方法依赖外部模块来强制执行安全约束,但未能解决MLLMs内部固有的漏洞。传统的监督微调(SFT)往往会过度拒绝无害输入,影响通用性能。鉴于上述挑战,我们提出了安全围观战(SecTOW),一种创新的迭代防御-攻击训练方法,用于增强MLLMs的安全性。SecTOW由两个模块组成:防御者和辅助攻击者,均使用强化学习(GRPO)进行迭代训练。在迭代过程中,攻击者识别防御模型中的安全漏洞并扩充越狱数据。然后,使用扩充后的数据训练防御者,以解决识别出的安全漏洞。我们还设计了用于GRPO的奖励机制,以简化响应标签的使用,减少对复杂生成标签的依赖,高效利用合成数据。此外,采用质量监控机制以缓解防御者对无害输入的过度拒绝,并确保攻击者生成的越狱数据具有多样性。在安全特定和通用基准测试上的实验结果表明,SecTOW在保持通用性能的同时显著提升了安全性。
引用
@article{arxiv.2507.22037,
title = {Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security},
author = {Muzhi Dai and Shixuan Liu and Zhiyuan Zhao and Junyu Gao and Hao Sun and Xuelong Li},
journal= {arXiv preprint arXiv:2507.22037},
year = {2025}
}
备注
10 pages, 4 figures