SmoothGuard:基于噪声扰动与聚类聚合防御多模态大语言模型
机器学习
2025-11-03 v1 密码学与安全
摘要
多模态大语言模型(MLLMs)通过联合处理文本和视觉输入在 diverse 任务上取得了显著的性能,但这些模型对对抗性操纵仍高度脆弱,这引发了在实际部署中关于其安全性和可靠性的广泛关注。本文首先推广了一种在 HuggingFace 生态系统中生成对抗图像的方法,然后引入 SmoothGuard——一种轻量级且模型无关的防御框架,通过随机噪声注入和基于聚类的预测聚合来增强 MLLMs 的鲁棒性。该方法对连续模态(如图像和音频)施加高斯噪声,生成多个候选输出,并应用基于嵌入的聚类来过滤受对抗性影响的预测。最终从多数簇中选择答案,确保即使在恶意扰动下也能获得稳定的响应。在 POPE、LLaVA-Bench(In-the-Wild)和 MM-SafetyBench 等大型实验中,SmoothGuard 在抵御对抗攻击的同时保持了具竞争力的实用性。消融研究进一步识别出在鲁棒性和实用性之间取得平衡的最佳噪声范围为 0.1-0.2。
引用
@article{arxiv.2510.26830,
title = {SmoothGuard: Defending Multimodal Large Language Models with Noise Perturbation and Clustering Aggregation},
author = {Guangzhi Su and Shuchang Huang and Yutong Ke and Zhuohang Liu and Long Qian and Kaizhu Huang},
journal= {arXiv preprint arXiv:2510.26830},
year = {2025}
}