SDEval:面向多模态大语言模型的安全动态评估
计算机视觉与模式识别
2026-01-06 v2
摘要
在多模态大语言模型(MLLMs)快速发展的背景下,其输出的安全问题已引起广泛关注。尽管已有众多数据集被提出,但它们可能随着MLLM的进步而过时,并且容易受到数据污染问题的影响。为了解决这些问题,我们提出了 \textbf{SDEval},这是\textit{首个}安全动态评估框架,用于可控地调整安全基准的分布和复杂性。具体而言,SDEval主要采用三种动态策略:文本动态、图像动态以及文本-图像动态,以从原始基准生成新样本。我们首先探索了文本和图像动态对模型安全性的单独影响。然后,我们发现将文本动态注入图像会进一步影响安全性,反之,将图像动态注入文本也会导致安全风险。SDEval具有足够的通用性,可应用于各种现有的安全甚至能力基准。在安全基准MLLMGuard和VLSBench,以及能力基准MMBench和MMVet上的实验表明,SDEval显著影响了安全评估,减轻了数据污染,并暴露了MLLM的安全局限性。代码可在 https://github.com/hq-King/SDEval 获取。
引用
@article{arxiv.2508.06142,
title = {SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models},
author = {Hanqing Wang and Yuan Tian and Mingyu Liu and Zhenhao Zhang and Xiangyang Zhu},
journal= {arXiv preprint arXiv:2508.06142},
year = {2026}
}
备注
AAAI 2026 poster