Computation and Language · Computer Science
Intention Analysis Makes LLMs A Good Jailbreak Defender
Yuqi Zhang, Liang Ding, Lefei Zhang, Dacheng Tao
2024-12-17
Cryptography and Security · Computer Science
Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing
Jinhua Yin, Peiru Yang, Chen Yang, Huili Wang +4
2025-11-05
Computer Vision and Pattern Recognition · Computer Science
OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language Models
Ryoto Miyamoto, Xin Fan, Fuyuko Kido, Tsuneo Matsumoto +1
2025-12-03
Machine Learning · Computer Science
Automatic Calibration for Membership Inference Attack on Large Language Models
Saleh Zare Zade, Yao Qiang, Xiangyu Zhou, Hui Zhu +3
2025-05-07
Machine Learning · Computer Science
AttenMIA: LLM Membership Inference Attack through Attention Signals
Pedram Zaree, Md Abdullah Al Mamun, Yue Dong, Ihsen Alouani +1
2026-01-27
Computer Vision and Pattern Recognition · Computer Science
Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models
Zongyu Wu, Minhua Lin, Zhiwei Zhang, Fali Wang +3
2026-02-05
Cryptography and Security · Computer Science
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Tianrui Guan +6
2025-06-17
Cryptography and Security · Computer Science
LUMIA: Linear probing for Unimodal and MultiModal Membership Inference Attacks leveraging internal LLM states
Luis Ibanez-Lissen, Lorena Gonzalez-Manzano, Jose Maria de Fuentes, Nicolas Anciaux +1
2025-01-13
Cryptography and Security · Computer Science
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
Zhaoqi Wang, Zijian Zhang, Daqing He, Pengtao Kou +4
2026-01-12
Cryptography and Security · Computer Science
AutoMIA: Improved Baselines for Membership Inference Attack via Agentic Self-Exploration
Ruhao Liu, Weiqi Huang, Qi Li, Xinchao Wang
2026-04-02
Artificial Intelligence · Computer Science
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
Jianyi Zhang, Shizhao Liu, Ziyin Zhou, Zhen Li
2025-12-23
Cryptography and Security · Computer Science
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
Haibo Tong, Dongcheng Zhao, Guobin Shen, Xiang He +3
2025-09-30
Computer Vision and Pattern Recognition · Computer Science
Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment
Jiaqing Li, Yajuan Lu, Xiaochuan Shi, Gang Wu +2
2026-05-19
Cryptography and Security · Computer Science
From static to adaptive: immune memory-based jailbreak detection for large language models
Jun Leng, Yu Liu, Litian Zhang, Ruihan Hu +2
2026-01-13
Computation and Language · Computer Science
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
Zhexin Zhang, Junxiao Yang, Pei Ke, Fei Mi +2
2024-06-13
Machine Learning · Computer Science
Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models
Zhaoxin Wang, Handing Wang, Cong Tian, Yaochu Jin
2025-05-23
Cryptography and Security · Computer Science
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
Zhengyue Zhao, Yingzi Ma, Somesh Jha, Marco Pavone +2
2025-10-21
Cryptography and Security · Computer Science
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
Yulong Chen, Qi Zhang, Jiawen Zhang, Yadong Liu +3
2026-05-12
Computer Vision and Pattern Recognition · Computer Science
Membership Inference Attacks against Large Vision-Language Models
Zhan Li, Yongtao Wu, Yihang Chen, Francesco Tonin +2
2024-11-06
Computation and Language · Computer Science
Do Membership Inference Attacks Work on Large Language Models?
Michael Duan, Anshuman Suri, Niloofar Mireshghallah, Sewon Min +6
2024-09-17
Cryptography and Security · Computer Science
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
Yongcan Yu, Yanbo Wang, Ran He, Jian Liang
2025-05-29