QGuard:基于问题的多模态大型语言模型零样本安全护卫
密码学与安全
2025-10-01 v3 人工智能
摘要
最近大型语言模型(LLM)的进展对从通用领域到专业领域的各个方面产生了重大影响。然而,这些进展也显著增加了恶意用户利用有害和越狱提示进行攻击的潜在风险。尽管已有许多努力旨在防止有害提示和越狱提示,但保护 LLM 免受此类恶意攻击仍是一个重要且具有挑战性的任务。本文提出QGuard,一种简单而有效的安全护卫方法,利用问题提示来零样本阻止有害提示。该方法不仅能防御基于文本的有害提示,还能防御多模态有害提示攻击。此外,通过对护卫问题进行多样化和修改,我们的方法在无需微调的情况下对最新的有害提示保持稳健性。实验结果表明,我们的模型在文本和多模态有害数据集上表现出竞争力。此外,通过对问题提示进行分析,我们实现了对用户输入的白盒分析。我们认为该方法为实际的 LLM 服务在缓解与有害提示相关的安全风险方面提供了有价值的见解。
引用
@article{arxiv.2506.12299,
title = {QGuard:Question-based Zero-shot Guard for Multi-modal LLM Safety},
author = {Taegyeong Lee and Jeonghwa Yoo and Hyoungseo Cho and Soo Yong Kim and Yunho Maeng},
journal= {arXiv preprint arXiv:2506.12299},
year = {2025}
}
备注
Accept to ACLW 2025 (WOAH); fix typo