面向多模态大语言模型的拒绝安全提示
密码学与安全
2024-09-09 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
多模态大语言模型(MLLM)已成为当今生成式AI生态系统的基石,推动了科技巨头和初创公司之间的激烈竞争。具体而言,MLLM在给定由图像和问题组成的提示后,生成文本响应。虽然最先进的MLLM使用安全过滤器和对齐技术来拒绝不安全提示,但本文提出了一种能够对安全提示产生拒绝响应的方法——MLLM-Refusal。该方法通过优化一个几乎不可感知的拒绝扰动,并将其添加到图像中,从而导致目标MLLM在包含扰动图像和安全问题的安全提示中可能拒绝响应。具体而言,我们将MLLM-Refusal形式化为一个受约束的优化问题,并提出了求解算法。该方法为MLLM模型提供商带来了竞争优势,因为竞争MLLM的用户在无意中使用这些扰动图像时,将收到意外的拒绝响应。我们在四个MLLM上测试了MLLM-Refusal,并在四个数据集上评估,证明其有效性:能够导致竞争MLLM拒绝安全提示,而不影响非竞争MLLM。此外,我们探讨了三种潜在对策——添加高斯噪声、DiffPure和对抗训练。结果表明,虽然这些方法可以缓解MLLM-Refusal的效果,但也会牺牲竞争MLLM的准确率和/或效率。代码已公开于 https://github.com/Sadcardation/MLLM-Refusal。
引用
@article{arxiv.2407.09050,
title = {Refusing Safe Prompts for Multi-modal Large Language Models},
author = {Zedian Shao and Hongbin Liu and Yuepeng Hu and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2407.09050},
year = {2024}
}