中文

VLMGuard: 基于无标签数据防御VLMs的恶意提示

机器学习 2024-10-02 v1 密码学与安全

摘要

视觉语言模型(VLM)是理解视觉和文本信息的关键技术。然而,它们对恶意操纵输入的脆弱性构成了重大风险,可能导致输出受损,并引发对VLM集成应用可靠性的广泛关注。因此,检测这些恶意提示对于维持VLM生成的可信度至关重要。开发防御性提示分类器的主要挑战在于缺乏大量标记的良性和恶意数据。为此,我们引入VLMGuard,一个新型学习框架,利用野生用户提示中的无标签数据进行恶意提示检测。这些无标签提示在VLM在野生环境中部署时自然生成,包含良性和恶意信息。为充分利用无标签数据,我们提出了一种自动化的恶性估计评分方法,用于区分无标签混合物中的良性和恶意样本,从而在其上训练二元提示分类器。值得注意的是,我们的框架无需额外的人类标注,为实际应用提供了强大的灵活性和实用性。大量实验表明,VLMGuard的检测效果显著优于现有的最先进方法。免责声明:本论文可能包含冒犯性示例;请读者自行判断。

关键词

引用

@article{arxiv.2410.00296,
  title  = {VLMGuard: Defending VLMs against Malicious Prompts via Unlabeled Data},
  author = {Xuefeng Du and Reshmi Ghosh and Robert Sim and Ahmed Salem and Vitor Carvalho and Emily Lawton and Yixuan Li and Jack W. Stokes},
  journal= {arXiv preprint arXiv:2410.00296},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2409.17504