中文

大反差决战:如何在视觉语言模型中让作囊和潜行相遇?

机器学习 2025-02-04 v2

摘要

视觉语言模型(VLMs)在各种任务上取得了显著的性能,但仍然容易受到会捏造攻击,这些攻击会损害其安全性和可靠性。本文提供了一个信息论框架,用于理解这些攻击有效性与其隐蔽性之间的根本性权衡。基于Fano不等式,我们展示了攻击者的成功概率与生成提示的隐蔽性密切相关。建立在此基础上,我们提出了一种高效的算法,用于检测非隐蔽的作囊攻击,显著改善了模型的鲁棒性。实验结果突显了强大攻击与其可检测性之间的紧张关系,为理解对抗策略和防御机制提供了见解。

关键词

引用

@article{arxiv.2410.01438,
  title  = {The Great Contradiction Showdown: How Jailbreak and Stealth Wrestle in Vision-Language Models?},
  author = {Ching-Chia Kao and Chia-Mu Yu and Chun-Shien Lu and Chu-Song Chen},
  journal= {arXiv preprint arXiv:2410.01438},
  year   = {2025}
}