Machine Learning · Computer Science
Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith
2026-05-13
Artificial Intelligence · Computer Science
PersonaTeaming: Exploring How Introducing Personas Can Improve Automated AI Red-Teaming
Wesley Hanwen Deng, Sunnie S. Y. Kim, Akshita Jha, Ken Holstein +3
2025-10-28
Computation and Language · Computer Science
A Context-Aware Approach for Textual Adversarial Attack through Probability Difference Guided Beam Search
Huijun Liu, Jie Yu, Shasha Li, Jun Ma +1
2022-08-18
Computation and Language · Computer Science
Purple-teaming LLMs with Adversarial Defender Training
Jingyan Zhou, Kun Li, Junan Li, Jiawen Kang +3
2024-07-03
Cryptography and Security · Computer Science
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An +2
2026-03-25
Machine Learning · Computer Science
Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning
Alex Beutel, Kai Xiao, Johannes Heidecke, Lilian Weng
2024-12-30
Machine Learning · Computer Science
Constrained Adversarial Perturbation
Virendra Nishad, Bhaskar Mukhoty, Hilal AlQuabeh, Sandeep K. Shukla +1
2025-10-20
Human-Computer Interaction · Computer Science
PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI
Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim, Akshita Jha +4
2026-05-12
Cryptography and Security · Computer Science
Training a General Purpose Automated Red Teaming Model
Aishwarya Padmakumar, Leon Derczynski, Traian Rebedea, Christopher Parisien
2026-04-28
Machine Learning · Computer Science
MAD-MAX: Modular And Diverse Malicious Attack MiXtures for Automated LLM Red Teaming
Stefan Schoepf, Muhammad Zaid Hameed, Ambrish Rawat, Kieran Fraser +3
2025-06-19
Cryptography and Security · Computer Science
Automated Progressive Red Teaming
Bojian Jiang, Yi Jing, Tianhao Shen, Tong Wu +2
2024-12-24
Computer Vision and Pattern Recognition · Computer Science
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
Zonghao Ying, Aishan Liu, Tianyuan Zhang, Zhengmin Yu +3
2024-07-02
Artificial Intelligence · Computer Science
Capability-Based Scaling Trends for LLM-Based Red-Teaming
Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko, Jonas Geiping
2026-02-10
Computer Vision and Pattern Recognition · Computer Science
AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts
Yufan Liu, Wanqian Zhang, Huashan Chen, Lin Wang +3
2025-10-29
Cryptography and Security · Computer Science
A Systematic Review of Algorithmic Red Teaming Methodologies for Assurance and Security of AI Applications
Shruti Srivastava, Kiranmayee Janardhan, Shaurya Jauhari
2026-02-26
Computation and Language · Computer Science
Attack Prompt Generation for Red Teaming and Defending Large Language Models
Boyi Deng, Wenjie Wang, Fuli Feng, Yang Deng +2
2023-10-20
Computer Vision and Pattern Recognition · Computer Science
Prompt-driven Transferable Adversarial Attack on Person Re-Identification with Attribute-aware Textual Inversion
Yuan Bian, Min Liu, Yunqi Yi, Xueping Wang +1
2025-07-18
Machine Learning · Computer Science
Potent but Stealthy: Rethink Profile Pollution against Sequential Recommendation via Bi-level Constrained Reinforcement Paradigm
Jiajie Su, Zihan Nan, Yunshan Ma, Xiaobo Xia +5
2025-12-23
Cryptography and Security · Computer Science
MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring
Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy
2026-05-12
Artificial Intelligence · Computer Science
Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning
Weiyang Guo, Zesheng Shi, Zhuo Li, Yequan Wang +5
2025-06-03
Computation and Language · Computer Science
MART: Improving LLM Safety with Multi-round Automatic Red-Teaming
Suyu Ge, Chunting Zhou, Rui Hou, Madian Khabsa +4
2023-11-15
Machine Learning · Computer Science
DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing Constraints
Andrew Zhao, Quentin Xu, Matthieu Lin, Shenzhi Wang +3
2024-12-23