JailbreakZoo:大型语言模型与视觉语言模型的安全越狱调查、图景与前沿
计算与语言
2025-11-11 v3 密码学与安全
计算机视觉与模式识别
机器学习
摘要
人工智能通过大型语言模型(LLMs)和视觉语言模型(VLMs)的快速发展,推动了多个技术领域的显著进步。尽管这些模型在自然语言处理和视觉交互任务中提升了能力,但其日益广泛的应用引发了关于安全性和伦理对齐的关键关注。本综述提供了关于破解——规避 LLMs 和 VLMs 伦理与操作边界——的新兴领域的全面回顾,以及随之而来的防御机制开发。我们的研究将破解分为七种 distinct 类型,阐述了针对这些漏洞的防御策略。通过这一全面检视,我们识别出研究空白,提出了未来研究方向,以增强 LLMs 和 VLMs 的安全框架。我们的发现强调,为了培育下一代语言模型的稳健、安全和可靠环境, необходим统一视角将破解策略与防御解决方案相结合。更多细节可在我们的网站上查阅:https://chonghan-chen.com/llm-jailbreak-zoo-survey/。
引用
@article{arxiv.2407.01599,
title = {JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models},
author = {Haibo Jin and Leyang Hu and Xinnuo Li and Peiyan Zhang and Chonghan Chen and Jun Zhuang and Haohan Wang},
journal= {arXiv preprint arXiv:2407.01599},
year = {2025}
}
备注
45 pages