Cryptography and Security · Computer Science
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
Jie Li, Yi Liu, Chongyang Liu, Ling Shi +4
2024-01-31
Cryptography and Security · Computer Science
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
Yanxu Mao, Tiehan Cui, Peipei Liu, Datao You +1
2025-08-04
Cryptography and Security · Computer Science
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang +2
2026-01-08
Computation and Language · Computer Science
Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models
Yanxu Mao, Peipei Liu, Tiehan Cui, Zhaoteng Yan +2
2025-05-30
Cryptography and Security · Computer Science
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
Benji Peng, Hanxuan Chen, Keyu Chen, Qian Niu +11
2026-05-29
Computation and Language · Computer Science
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
Tianlong Li, Zhenghua Wang, Wenhao Liu, Muling Wu +5
2025-02-24
Cryptography and Security · Computer Science
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
Sibo Yi, Yule Liu, Zhen Sun, Tianshuo Cong +4
2024-09-02
Cryptography and Security · Computer Science
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
Fenghua Weng, Yue Xu, Chengyan Fu, Wenjie Wang
2024-10-23
Computation and Language · Computer Science
Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks
Erfan Shayegani, Md Abdullah Al Mamun, Yu Fu, Pedram Zaree +2
2023-10-18
Computation and Language · Computer Science
Recent advancements in LLM Red-Teaming: Techniques, Defenses, and Ethical Considerations
Tarun Raheja, Nilay Pochhi, F. D. C. M. Curie
2024-12-18
Computer Vision and Pattern Recognition · Computer Science
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
Daizong Liu, Mingyu Yang, Xiaoye Qu, Pan Zhou +2
2024-07-15
Cryptography and Security · Computer Science
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini +1
2026-01-12
Artificial Intelligence · Computer Science
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
Haoxuan Ji, Zheng Lin, Zhenxing Niu, Xinbo Gao +1
2025-12-02
Computation and Language · Computer Science
Dark LLMs: The Growing Threat of Unaligned AI Models
Michael Fire, Yitzhak Elbazis, Adi Wasenstein, Lior Rokach
2025-05-16
Cryptography and Security · Computer Science
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
Youze Wang, Wenbo Hu, Yinpeng Dong, Jing Liu +2
2025-06-03
Cryptography and Security · Computer Science
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
Tom Gibbs, Ethan Kosak-Hine, George Ingebretsen, Jason Zhang +5
2024-09-04
Cryptography and Security · Computer Science
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
Tianyu Zhang, Zixuan Zhao, Jiaqi Huang, Jingyu Hua +1
2024-04-15
Cryptography and Security · Computer Science
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
Weidi Luo, Siyuan Ma, Xiaogeng Liu, Xiaoyu Guo +1
2024-11-26
Computation and Language · Computer Science
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
Kexin Chen, Yi Liu, Dongxia Wang, Jiaying Chen +1
2024-08-20
Cryptography and Security · Computer Science
SoK: Robustness in Large Language Models against Jailbreak Attacks
Feiyue Xu, Hongsheng Hu, Chaoxiang He, Sheng Hang +8
2026-05-07
Computation and Language · Computer Science
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang +3
2025-11-11
Cryptography and Security · Computer Science
Recent Advances in Attack and Defense Approaches of Large Language Models
Jing Cui, Yishi Xu, Zhewei Huang, Shuchang Zhou +2
2024-12-03