LLaVAShield:保障视觉语言模型中的多模态多轮对话安全
计算机视觉与模式识别
2026-03-11 v3
摘要
随着视觉语言模型 (VLM) 进入交互式多轮应用,多模态多轮对话的安全问题日益突出,其特征在于恶意意图的隐蔽性、上下文风险的累积性以及跨模态联合风险。这些特征限制了为单轮或单模态设置设计的内容审核方法的有效性。为了解决这些局限性,我们首先构建了多模态多轮对话安全 (MMDS) 数据集,包含 4,484 个标注对话以及包含 8 个主维度和 60 个子维度的全面风险分类体系。作为 MMDS 构建的一部分,我们引入了多模态多轮红队测试 (MMRT),这是一个用于生成不安全多模态多轮对话的自动化框架。我们进一步提出了 LLaVAShield,它在多模态多轮对话中审核用户输入和助手响应在指定策略维度下的安全性。大量实验表明,LLaVAShield 显著优于最先进的 VLM 和现有内容审核工具,同时展现出强大的泛化能力和灵活的策略适应性。此外,我们分析了主流 VLM 对有害输入的脆弱性,并评估了关键组件的贡献,推进了对多模态多轮对话中安全机制的理解。
引用
@article{arxiv.2509.25896,
title = {LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models},
author = {Guolei Huang and Qinzhi Peng and Gan Xu and Yao Huang and Yuxuan Lu and Yongjun Shen},
journal= {arXiv preprint arXiv:2509.25896},
year = {2026}
}
备注
Accepted to CVPR 2026